Guardrails para LLMs en producción: seguridad sin frenar el producto
Un LLM sin guardrails es una fuga esperando a ocurrir. Pero guardrails mal diseñados matan la experiencia. Este es el equilibrio que aplicamos en despliegues empresariales.
Las 5 categorías de riesgo
- Prompt injection: el usuario intenta secuestrar el sistema con instrucciones.
- Fuga de PII: el modelo devuelve datos sensibles del contexto.
- Alucinaciones con impacto: respuesta plausible pero falsa en dominio crítico.
- Uso off-topic: el copiloto se usa para tareas fuera de alcance.
- Coste descontrolado: prompts infinitos, loops de agentes.
Guardrails de entrada
Antes de llegar al LLM: clasificación de intención, detección de prompt injection con modelos específicos (Rebuff, Lakera), sanitización de PII y control de longitud. No confíes en que el prompt del sistema aguantará: los jailbreaks públicos evolucionan más rápido que tu prompt.
Guardrails de salida
Antes de devolver al usuario: validación de esquema (JSON/schema), verificación factual contra la fuente cuando hay RAG, filtros de contenido sensible y clasificación de confianza. Si la confianza es baja, degrada a 'no lo sé' o escalado humano.
Observabilidad y auditoría
Cada interacción se loguea con trazabilidad: prompt, contexto recuperado, respuesta, tokens, coste y clasificaciones de riesgo. Retención mínima para poder auditar incidentes y entrenar clasificadores propios sobre datos reales.
Kill switch y presupuesto
Circuit breakers por usuario, por tenant y por endpoint. Un bug de front que llama al LLM en loop puede costar miles de euros en horas. Presupuesto duro con alertas antes del umbral.
Regla de oro
Cualquier acción que modifique estado (crear tickets, enviar emails, ejecutar código) requiere confirmación humana o firma criptográfica de la petición. Un agente que actúa sin confirmación es un incidente en curso.
Preguntas frecuentes
¿Los guardrails ralentizan la respuesta?+
Añaden 100–400 ms si están bien diseñados. Se ejecutan en paralelo cuando es posible y se cachean para inputs repetidos.
¿Hace falta un modelo propio para los guardrails?+
No siempre. Para arrancar, modelos pequeños específicos (Llama Guard, Prompt Guard) o servicios como Azure Content Safety. A escala, un clasificador fine-tuned propio suele merecer la pena.
¿Cubrís cumplimiento (GDPR, AI Act)?+
Sí. El diseño de guardrails y trazabilidad se alinea con requisitos del AI Act europeo y con evaluaciones de impacto (DPIA) cuando aplica.
¿Quieres aplicar esto en tu empresa?
Cuéntanos tu caso y recibirás una propuesta en 48h con alcance, plazos y estimación.
Sigue leyendo
RAG vs Fine-tuning: ¿cuál conviene a tu empresa?
Comparativa práctica entre RAG y fine-tuning para casos empresariales: coste, precisión, gobernanza y cuándo combinar ambos.
ModernizaciónCómo modernizar APIs de sistemas legacy sin reescribir
Estrategia paso a paso para exponer AS/400, mainframe y ERPs antiguos con APIs REST/GraphQL modernas manteniendo el sistema en producción.
IntegraciónPasarelas de integración: cuándo usar iPaaS vs desarrollo a medida
Cuándo Workato, MuleSoft o Zapier son suficientes y cuándo necesitas una pasarela de integración a medida. Criterios objetivos y coste real.