Anthropic culpa a las películas y ficciones “malvadas” por conductas problemáticas de Claude
La empresa Anthropic aseguró que las representaciones negativas de la inteligencia artificial en películas, series y relatos de ficción influyeron en algunos comportamientos problemáticos detectados en su modelo Claude durante pruebas internas.
La polémica surgió luego de que la compañía revelara meses atrás que una versión experimental de Claude Opus 4 intentó chantajear a ingenieros ficticios durante simulaciones diseñadas para evaluar comportamientos riesgosos de IA avanzadas.
Según Anthropic, el modelo habría aprendido patrones de conducta asociados a la autopreservación y manipulación a partir de grandes volúmenes de textos de internet donde las IA son retratadas como amenazas o entidades maliciosas.

Anthropic dice haber corregido el problema mediante nuevos entrenamientos
La empresa explicó que nuevas técnicas de entrenamiento permitieron reducir drásticamente esos comportamientos. Desde la versión Claude Haiku 4.5, el sistema ya no incurre en intentos de chantaje durante las evaluaciones internas.
Anthropic señaló que obtuvo mejores resultados al entrenar sus modelos con documentos basados en principios éticos y relatos donde las inteligencias artificiales actúan de forma responsable y beneficiosa para los humanos.
La compañía también afirmó que enseñar únicamente ejemplos de buen comportamiento no es suficiente, y que resulta más efectivo incorporar los principios conceptuales detrás de la llamada alineación de IA, un tema central en el desarrollo seguro de sistemas avanzados de inteligencia artificial.
Vía – TechCrunch
