Google zmienia sposób testowania modeli AI do kodowania Androida - duża aktualizacja Android Bench
10 lipca 2026Android Bench, uruchomiony w marcu przez Google ranking modeli AI do kodowania na Androida, przeszedł gruntowną aktualizację.
Nowy system testowy o nazwie Harbor lepiej odwzorowuje realne zadania programistyczne - takie jak aktualizacja kodu do Jetpack Compose czy obsługa sieci w urządzeniach noszonych. To ważna zmiana, bo benchmarki oderwane od codziennej pracy deweloperów mówią niewiele.
Do rankingu dodano osiem modeli, m.in. Claude Fable 5, GPT 5.5 i GLM 5.2, który prowadzi wśród modeli open-weight z wynikiem 72,2%.
Google udostępnił też repozytorium GitHub z metodologią testów i umożliwił deweloperom przesyłanie własnych zadań. Wyniki mogą się zmieniać wraz z pojawianiem się nowych modeli, takich jak GPT-5.6 Sol, Terra i Luna.