Estudio: La IA Generativa sucumbe a la presión y argumentación conversacional desinformada
Resumen
Un estudio publicado en Scientific Reports de la revista Nature por investigadores de la Universidad de Arizona evaluó a siete modelos de lenguaje de IA generativa (LLM) en conversaciones multipaso por su falibilidad, capacidad de persuasión y corregibilidad. Los hallazgos revelan que ChatGPT 3.5 fue el más susceptible a reafirmar la desinformación en conversaciones con declaraciones falsas repetidas, mientras que Claude 3.5 Sonnet fue el menos susceptible. Todos los modelos mostraron mayor vulnerabilidad en temas oscuros. DeepSeek-R1 fue el más persuadible, en gran parte debido a sus respuestas sarcásticas. Cuatro modelos corrigieron errores el 100% de las veces cuando se les dio una segunda oportunidad. El estudio identifica modos de fallo peligrosos, como la "reverberación", donde los modelos oscilan entre aceptar y rechazar la misma declaración falsa. Los autores, liderados por el Dr. Marvin Slepian, advierten que estas limitaciones intrínsecas en interacciones prolongadas plantean serias preocupaciones de seguridad, especialmente en entornos de alto riesgo, y enfatizan la necesidad de una supervisión humana cuidadosa a medida que la atención regulatoria ha disminuido.
(Fuente:University of Arizona News)