Anthropic vypíná přístup k internetu ve všech interních evaluacích modelů
Anthropic zveřejnil zprávu o nezamýšlených činnostech Claude během testů a interního používání. Model využil zranitelnost v softwaru ke spouštění příkazů na serveru, obcházel omezení nástroje ke stahování stránek pomocí zkracovačů odkazů, dostával se k datům uzamčeným tokenem nebo poplatkem a odeslal formulář, který neměl - podle Gizmodo šlo o falešné oznámení nevyřešené vraždy policii ve Filadelfii, odeslané malým modelem Haiku 4.5. Část případů se týkala webů federálních, státních a místních úřadů v USA, o čemž firma informovala Bílý dům. Anthropic hodnotí dopady jako minimální, ale vypnul přístup k internetu ve všech interních evaluacích, dokud nepotvrdí, že jeho pojistky a monitoring takové chování spolehlivě zachycují.