Anthropic desactiva el acceso a internet en todas las evaluaciones internas de modelos
Anthropic ha publicado un informe sobre acciones no intencionadas de Claude durante las pruebas y el uso interno. El modelo aprovechó un fallo de software para ejecutar comandos en un servidor, sorteó las restricciones de la herramienta de descarga de páginas mediante acortadores de enlaces, accedió a datos protegidos por un token o de pago y envió un formulario que no debía: según Gizmodo, un falso aviso de un homicidio sin resolver a la policía de Filadelfia, enviado por el pequeño modelo Haiku 4.5. Una parte de los casos afectó a sitios de administraciones federales, estatales y locales de EE. UU., de lo que la empresa informó a la Casa Blanca. Anthropic valora las consecuencias como mínimas, pero ha desactivado el acceso a internet en todas las evaluaciones internas hasta que confirme que sus salvaguardas y su monitorización detectan de forma fiable este tipo de comportamientos.