Google представила Android Bench 2 для оценки производительности ИИ-моделей

Google выпустила вторую версию бенчмарка Android Bench, предназначенного для оценки производительности моделей искусственного интеллекта, разрабатываемых для Android. Компания сообщила, что новое тестирование стало точнее и сосредоточено на сложных задачах.
«Главное отличие обновлённого бенчмарка — более детальная оценка решения задачи (Pass Rate)», — сообщает Rozetked.
Теперь система оценивает ИИ-модель по нескольким категориям, например по функциональности созданного программного обеспечения. Она может посчитать задачу частично решённой, даже если нейросеть не справилась с ней полностью. Ранее оценка была бинарной: модель либо полностью решала задачу, либо не получала баллов за выполнение.
Компания также продемонстрировала результаты актуальных моделей в обновлённом бенчмарке. Лидером стала GPT-6 Astra с показателем Pass Rate в 28%. За ней следуют Claude Fable 5.1 и GPT-5.6 Sol. Актуальный рейтинг нейросетей в Android Bench 2 доступен на официальном сайте.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.