Обновление демонстрирует заметный качественный скачок в профильных тестах. В испытаниях FrontierCode 1.1 Main точность генерации готового кода поднялась с 34,4% до 43,6%, а в DeepSWE v1.1 результат вырос с 49% до 65,3%. Модель лучше справляется с версткой UI, точнее копируя дизайн-макеты и скриншоты, что подтверждается рейтингом 1588 баллов Elo на WebDev Arena.
Помимо написания кода, разработчики улучшили работу с документацией и бизнес-автоматизацией. В тесте GDP.pdf модель показала 34% точности против 22% у предшественницы, а в AutomationBench её результативность подскочила с 17% до 30,4%. Улучшенное многошаговое планирование позволяет системе реже требовать ручной корректировки при выполнении сложных инструкций.





Комментарии (0)
Пока нет комментариев. Будьте первым!