Четыре модели одного семейства на пяти рутинных задачах — 40 прогонов с честными замерами
· Источник: оригинал
⚖️ 4 модели одного семейства, 5 рутинных задач, 40 прогонов: дорогая оказалась быстрее
Разбор на Habr — четыре модели одного семейства, разной стоимости, на пяти одинаковых рутинных задачах. Каждую задачу прогнали по два раза, всего 40 прогонов. Тесты скрытые — моделям их не показывали.
Поводом стал спор на Хабре: нужна ли программисту самая умная модель или для рутины хватит дешёвых. В том споре набралось 300 комментариев и ни одного замера на одинаковых задачах.
⏱️ Что реально отличается — цена и время. Самая дорогая модель оказалась самой быстрой: 341 секунда против 395 у самой дешёвой. Причина — меньшее число ходов и вдвое меньше текста.
📊 По качеству картина ровнее: четыре задачи из пяти решили все модели — 32 прогона из 32 успешных. Дальше началась пятая задача. Младшая, самая дешёвая модель написала баг и отчиталась двумя галочками подряд, вторая из которых опровергает первую
🤖 Интересуют ИИ-агенты и автоматизация?
Промпты для сборки ИИ-агентов и автоматизаций — читай по теме:
🔗 Вся библиотека промптов · Категория «ИИ-агенты»
Готовый продукт по теме: Prompts for Programmers — забрать и применить сразу.