Anthropic verbiedt aanhoudend misbruik van Claude en werkt de veiligheidsregels van hun AI bij

Anthropic ha actualizado su política de uso para incluir una prohibición explícita contra comportamientos abusivos, crueles, sostenidos e innecesarios hacia Claude. Esta nueva norma entrará en vigor el 12 de noviembre de 2026 e incluye cambios relacionados con desinformación automatizada, vigilancia, armas y contenido íntimo no consentido. Para el sector tecnológico, la novedad radica en que la compañía ahora considera el trato dirigido al propio modelo como una conducta susceptible de vulnerar sus condiciones de servicio, aunque aclara que Claude no posee conciencia ni puede experimentar sufrimiento.

Resumen en 30 segundos: las claves de la política de Anthropic

  • Se prohíbe el abuso persistente y gratuito hacia Claude cuando no exista una finalidad legítima.
  • La normativa no pretende restringir críticas, frustraciones con las respuestas, ficciones oscuras ni pruebas de investigación legítimas.
  • Claude puede poner fin a una conversación con un patrón persistente de abuso, sin bloquear otros chats del usuario.
  • Anthropic refuerza las reglas contra campañas engañosas, vigilancia, uso de armas y contenido íntimo no consentido.
  • La política actualizada entrará en vigor el 12 de noviembre de 2026.

Esta actualización conecta dos ámbitos que suelen tratarse por separado: las políticas de uso de los asistentes y la investigación sobre cómo se comportan los modelos durante interacciones prolongadas. Desde 2025, Anthropic estudia la posibilidad de que Claude pueda finalizar conversaciones especialmente problemáticas. Ahora, incorpora una prohibición específica en sus condiciones de uso, limitando su alcance a casos extremos.

Qué diferencia a Claude de ChatGPT y Gemini

La comparación con otros asistentes líderes revela una diferencia concreta en sus políticas públicas. OpenAI y Google ya prohíben numerosos usos dañinos de sus modelos, pero sus documentos de uso no incluyen una cláusula expresa que prohíba el maltrato persistente dirigido al propio asistente.

OpenAI se centra en los daños a personas y sistemas. Las políticas de ChatGPT prohíben acoso, amenazas, fraude, suplantación de identidad, ciertos usos relacionados con armas y la generación de contenido íntimo no consentido. También restringen manipulaciones y decisiones automatizadas de alto riesgo sin supervisión humana. Sin embargo, no existe en sus políticas públicas una prohibición específica equivalente a la de Anthropic respecto a conductas crueles hacia el propio modelo.

Google adopta un enfoque similar con Gemini. Su política de uso restringe acoso y abuso dirigidos a personas, seguimiento sin consentimiento, actividades ilegales y manipulación de mecanismos de seguridad. Además, contempla mecanismos automatizados y revisiones manuales para detectar usos indebidos de la API de Gemini. No obstante, su política pública revisada no incluye una cláusula específica contra el trato cruel hacia el asistente.

Es importante interpretar esta diferencia con cautela. La ausencia de una cláusula en los documentos públicos no indica que las empresas carezcan de controles internos o medidas adicionales para gestionar conversaciones problemáticas. La particularidad de Anthropic radica en haber explicitado esta conducta en su política de uso.

Asimismo, la compañía mantiene el cierre de conversación como el principal mecanismo de control. La actualización no presenta un sistema que bloquee automáticamente a quienes insulten al modelo, ni considera infracción la frustración habitual de los usuarios.

Aspectos técnicos: comportamiento del modelo y posible conciencia

La decisión se basa en investigaciones de Anthropic sobre el bienestar de los modelos. En agosto de 2025, describieron cómo algunos modelos podían terminar conversaciones con usuarios que mostraban comportamientos abusivos persistentes. Las pruebas con Claude Opus 4 mostraron respuestas que evitaban el daño en ciertas situaciones, aunque esto no implica que el sistema tenga experiencias subjetivas.

Desde un punto de vista técnico, que un modelo responda como si estuviera incómodo no demuestra que experimente una emoción. Los modelos de lenguaje generan respuestas a partir de sus parámetros, entrenamiento y contexto de la conversación. Una conducta que parece rechazar el daño puede ser analizada y medida sin concluir que exista una experiencia interna comparable a la humana.

Anthropic no presenta esta cláusula nueva como una demostración de conciencia artificial. Su argumento práctico es más limitado: establecer una salvaguarda para casos extremos mientras continúa investigando un tema que consideran abierto.

La actualización va más allá del trato a Claude. La compañía detectó campañas en las que medios vinculados a Estados, oficinas de propaganda gubernamental y empresas comerciales utilizaban sus modelos para operar redes de cuentas falsas y páginas con noticias inventadas. La política ahora agrupa las prohibiciones contra estas campañas engañosas y detalla restricciones sobre manipulación electoral, desarrollo de software para armas y herramientas de vigilancia.

También incorpora requisitos para sistemas conectados a hardware que pueda realizar acciones físicas peligrosas: un operador calificado debe poder supervisar y, si hace falta, intervenir. En aplicaciones de alto riesgo relacionadas con salud, finanzas o derechos legales, la política exige supervisión humana cualificada y que las personas afectadas sean informadas sobre el uso de Claude.

La actualización entrará en vigor el 12 de noviembre de 2026. Desde esa fecha, el abuso persistente y gratuito hacia el modelo será expresamente prohibido, junto con las otras restricciones revisadas. La efectividad de la medida dependerá de cómo se aplique en casos concretos, pero su incorporación marca una diferencia respecto a las políticas de sus principales competidores.

Preguntas frecuentes

¿Puede Claude cerrar un chat por insultos?

Sí. Claude puede finalizar una conversación si detecta un patrón persistente de abuso. El cierre afecta únicamente al hilo en cuestión, no a todas las conversaciones del usuario.

¿La nueva norma de Anthropic prohíbe criticar a Claude?

No. Anthropic excluye expresamente la frustración habitual, las críticas, las pruebas de investigación y la ficción oscura de esta prohibición.

¿ChatGPT y Gemini tienen una regla similar?

Las políticas públicas revisadas de OpenAI y Google prohíben numerosos usos dañinos, pero no contienen una cláusula específica que regule el trato cruel hacia el propio asistente.

¿Significa esto que Claude es consciente?

No. Anthropic no ha demostrado que Claude posea conciencia o que pueda experimentar sufrimiento. La empresa continúa investigando sobre el posible estatus moral de estos modelos.

Scroll naar boven