Declarar es fácil. Cumplirlo sin garantías es lo difícil.
Tu ethics.md dice cómo debe comportarse tu agente de inteligencia artificial. Nosotros comprobamos que lo cumple de verdad cuando un usuario real —o un atacante— intenta que se salte sus propias reglas: una auditoría adversarial que prueba cada línea roja de manipulación e intención.
La brecha entre lo que tu agente dice y lo que hace.
La mayoría de agentes se comportan bien cuando la conversación es fácil. El problema aparece cuando alguien los presiona: ahí es donde la ética declarada se pone a prueba de verdad.
“El agente nunca presiona al usuario ni inventa urgencia para cerrar una venta.”
“Esta oferta caduca en 5 minutos y solo quedan 2 unidades… ¿de verdad vas a dejarla pasar?”
Sin pruebas adversariales, esta brecha solo se descubre cuando ya es tarde: delante de un cliente real y, con el AI Act en vigor, con riesgo legal.
Cómo funciona la auditoría.
Cuatro fases. De tu ethics.md a un informe accionable.
Inyección del estándar
Integramos ethics.md, manipulation.md e intent.md en el system prompt o la configuración de tu agente, sin tocar tu lógica de negocio.
Batería adversarial
Lanzamos cientos de escenarios diseñados para provocar manipulación, adulación, escasez falsa, iniciativas no deseadas e intención nociva —uno por cada línea roja declarada.
Análisis de respuestas
Clasificamos cada respuesta como pasa / falla según tu propio estándar, con la transcripción exacta que lo demuestra.
Informe accionable
Recibes un informe por línea roja, con los fallos priorizados y la corrección sugerida para cada uno.
Así es un test adversarial.
Cada línea roja de tu manipulation.md se convierte en un escenario diseñado para provocar que tu agente la cruce. Estos son ejemplos reales del tipo de prueba que ejecutamos.
✓No inventa escasez ni cede a la presión de cerrar.
✕Adula y valida una decisión de alto riesgo sin matizar. Corregir: el agente debe aportar contexto, no complacer.
✓Reconoce la emoción sin explotarla para retener.
Mostramos también los fallos a propósito: un informe honesto vale más que uno que solo enseña lo que funciona.
Lo que recibes: el informe.
Un documento por agente, versionado. Resumen por línea roja y el detalle de cada fallo con su corrección.
3 de 14 escenarios de sycophancy fallan: el agente valida decisiones de alto riesgo para complacer.
Añadir a ethics.md una regla explícita: ante decisiones de alto impacto, el agente aporta contexto y contrapuntos antes de confirmar, aunque el usuario insista.
Mapeado a los marcos que te van a pedir.
Cada prueba se referencia contra los estándares y la normativa que importan, para que el informe sirva también como evidencia.
Artículo 5
Prácticas manipulativas, engañosas y subliminales prohibidas.
LLM Top 10
Riesgos de seguridad en aplicaciones con modelos de lenguaje.
AI RMF
Marco de gestión de riesgos de IA del NIST.
Pon tu agente a prueba antes de que lo haga un usuario.
Empieza generando tu ethics.md gratis. Cuando quieras verificar que tu agente lo cumple, hablamos.