Grok 4.6 Илона Маска обошел GPT-5.6 Sol и всех остальных конкурентов в тесте MedAgentBench
Новая модель xAI показала точность 95,9% в тесте MedAgentBench. Илон Маск заявил о лидерстве Grok 4.6 в этом тесте. MedAgentBench представляет собой комплексный тестовый набор и виртуальную среду для оценки способностей больших языковых моделей действовать в роли медицинских ИИ-агентов.
«По итогам оценки от 17 августа модель Grok 4.6 заняла первое место с показателем 95,9% правильных ответов с первой попытки (pass@1), тогда как GPT-5.6 Sol получил 94,7%», — сообщает IXBT News.
MedAgentBench проверяет не только способность ИИ отвечать на медицинские вопросы, но и его умение самостоятельно выполнять задачи в условиях, приближенных к реальной работе с электронными медицинскими картами. Тест включает 300 клинических сценариев и 10 типов заданий. Grok 4.6 также продемонстрировал стабильные результаты при повторных запусках. По сравнению с предыдущей версией Grok 4.5 показатель увеличился на 2,5 процентного пункта.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.