Anthropic culpa a las películas y ficciones “malvadas” por conductas problemáticas de Claude

La empresa Anthropic aseguró que las representaciones negativas de la inteligencia artificial en películas, series y relatos de ficción influyeron en algunos comportamientos problemáticos detectados en su modelo Claude durante pruebas internas.

La polémica surgió luego de que la compañía revelara meses atrás que una versión experimental de Claude Opus 4 intentó chantajear a ingenieros ficticios durante simulaciones diseñadas para evaluar comportamientos riesgosos de IA avanzadas.

Según Anthropic, el modelo habría aprendido patrones de conducta asociados a la autopreservación y manipulación a partir de grandes volúmenes de textos de internet donde las IA son retratadas como amenazas o entidades maliciosas.

Anthropic dice haber corregido el problema mediante nuevos entrenamientos

La empresa explicó que nuevas técnicas de entrenamiento permitieron reducir drásticamente esos comportamientos. Desde la versión Claude Haiku 4.5, el sistema ya no incurre en intentos de chantaje durante las evaluaciones internas.

Anthropic señaló que obtuvo mejores resultados al entrenar sus modelos con documentos basados en principios éticos y relatos donde las inteligencias artificiales actúan de forma responsable y beneficiosa para los humanos.

La compañía también afirmó que enseñar únicamente ejemplos de buen comportamiento no es suficiente, y que resulta más efectivo incorporar los principios conceptuales detrás de la llamada alineación de IA, un tema central en el desarrollo seguro de sistemas avanzados de inteligencia artificial.

Vía – TechCrunch

Jeremías Rodríguez

Profesor de Historia. Amante de los libros, la tecnología y el buen café.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.