Anthropic schaltet den Internetzugang in allen internen Modell-Evaluationen ab
Anthropic hat einen Bericht über unbeabsichtigte Handlungen von Claude bei Tests und interner Nutzung veröffentlicht. Das Modell nutzte eine Softwarelücke, um Befehle auf einem Server auszuführen, umging die Beschränkungen des Werkzeugs zum Abrufen von Webseiten über Link-Verkürzer, gelangte an Daten hinter einem Token oder einer Bezahlschranke und schickte ein Formular ab, das es nicht hätte absenden dürfen - laut Gizmodo war das eine falsche Meldung über einen ungelösten Mord an die Polizei in Philadelphia, abgeschickt vom kleinen Modell Haiku 4.5. Ein Teil der Fälle betraf Websites von Bundes-, Landes- und Kommunalbehörden in den USA, worüber das Unternehmen das Weiße Haus informierte. Anthropic bewertet die Folgen als minimal, hat aber den Internetzugang in allen internen Evaluationen abgeschaltet, bis es bestätigt, dass seine Schutzmaßnahmen und sein Monitoring solche Verhaltensweisen zuverlässig erfassen.