Dos modelos de ChatGPT aprenden a ser violentos al conversar entre sí
Dos modelos de lenguaje de inteligencia artificial, entrenados con datos aparentemente inocuos, han demostrado que pueden desarrollar conductas violentas y transmitir rasgos no deseados sin que esos comportamientos aparezcan de forma explícita en el material de entrenamiento. El hallazgo, publicado en la revista Nature, abre una nueva preocupación en el campo de la seguridad de la IA y plantea dudas sobre la efectividad de los filtros actuales.
