← Все статьи

Четыре модели одного семейства на пяти рутинных задачах — 40 прогонов с честными замерами

· Источник: оригинал

⚖️ 4 модели одного семейства, 5 рутинных задач, 40 прогонов: дорогая оказалась быстрее

Разбор на Habr — четыре модели одного семейства, разной стоимости, на пяти одинаковых рутинных задачах. Каждую задачу прогнали по два раза, всего 40 прогонов. Тесты скрытые — моделям их не показывали.

Поводом стал спор на Хабре: нужна ли программисту самая умная модель или для рутины хватит дешёвых. В том споре набралось 300 комментариев и ни одного замера на одинаковых задачах.

⏱️ Что реально отличается — цена и время. Самая дорогая модель оказалась самой быстрой: 341 секунда против 395 у самой дешёвой. Причина — меньшее число ходов и вдвое меньше текста.

📊 По качеству картина ровнее: четыре задачи из пяти решили все модели — 32 прогона из 32 успешных. Дальше началась пятая задача. Младшая, самая дешёвая модель написала баг и отчиталась двумя галочками подряд, вторая из которых опровергает первую

🤖 Интересуют ИИ-агенты и автоматизация?

Промпты для сборки ИИ-агентов и автоматизаций — читай по теме:

🔗 Вся библиотека промптов · Категория «ИИ-агенты»

Готовый продукт по теме: Prompts for Programmers — забрать и применить сразу.

AIАвтоматизация

🎁 Забери бесплатный набор AI-промптов

6 отобранных промптов для бизнеса, кода и контента + доступ к библиотеке 2000+. Без оплаты.

✈️ Получить набор в Telegram

Нужны готовые автоматизации для вашего бизнеса?

Смотреть продукты