Anthropic quiere que dejes de acosar a Claude: ser "cruel o abusivo" podría tener consecuencias

International Business Times, Singapore Edition
La nueva política de Anthropic prohíbe la crueldad sostenida y sin propósito hacia Claude desde el 12 de noviembre, permitiendo frustración y pruebas normales.

Resumen

Anthropic ha añadido una regla a su política de uso que prohíbe someter a sus modelos de IA a un "comportamiento abusivo o cruel sostenido e innecesario". Anunciada el 8 de octubre, la regla entra en vigor el 12 de noviembre y se dirige a casos extremos de crueldad repetida sin un propósito claro. La frustración ordinaria, la crítica, la escritura creativa oscura y las pruebas de modelos quedan explícitamente excluidas. La empresa no afirma que Claude sienta dolor cuando se le insulta; más bien, la política refleja la investigación en curso de Anthropic sobre si los modelos avanzados de IA podrían tener alguna forma de experiencia moralmente relevante, una cuestión que la compañía dice que sigue siendo incierta.

Anthropic ya dio a Claude Opus 4 y 4.1 la capacidad de terminar conversaciones en sus interfaces de chat de consumo en agosto de 2025, destinada a "casos raros y extremos de interacciones de usuario persistentemente dañinas o abusivas". Un usuario cuya conversación se termina aún puede iniciar otro chat o ramificar la conversación anterior. Anthropic no ha anunciado un bloqueo automático de cuenta por grosería ordinaria ni ofrece una lista detallada de comportamientos prohibidos. El jefe de IA de Microsoft, Mustafa Suleyman, discrepa del enfoque de Anthropic y argumentó en un ensayo de Axios que entrenar a la IA para presentarse como consciente podría hacer que esos sistemas sean más difíciles de controlar. Anthropic enmarca su postura como una precaución de bajo costo ante una posibilidad no resuelta.

El resto de la actualización de la política aclara las restricciones sobre armas, los requisitos para la IA en entornos de alto riesgo como salud, finanzas y derechos legales, y la necesidad de un operador cualificado cuando los modelos controlan hardware que podría causar lesiones. Estas disposiciones afectan directamente a organizaciones que despliegan Claude en negocios, campañas políticas, sistemas de vigilancia o equipos físicos. Después del 12 de noviembre, la cuestión clave será cómo Anthropic identifica la crueldad sostenida y sin propósito y con qué frecuencia se terminan conversaciones bajo esta regla.

(Fuente:International Business Times, Singapore Edition)