Какую LLM выбрать — методика своего бенчмарка на 24 вопросах по рабочим данным
· Source: original
🛠️ Свой бенчмарк на 24 вопросах: как выбрать LLM под рабочие данные
Публичные рейтинги не показывают, как модель справится с конкретными задачами и сколько это будет стоить. На Habr вышла методика ровно про это — статья 1089876.
Задача — выбрать LLM под живой электронный лабораторный журнал, то есть базу данных экспериментов и измерений.
Что прогоняли: 24 вопроса по этому журналу на DeepSeek, ChatGPT и Claude. В тесте — 19 сочетаний «модель + уровень усилий при рассуждении» (reasoning effort). Всего примерно 450 прогонов.
Запуск вопросов по живому журналу шёл через MCP — прямо по рабочей базе. Дата оценки актуальности материалов в дайджесте — 04 October 2026.
Пошагово под свою задачу:
1. Взять свой рабочий массив данных — здесь в этой роли лабораторный журнал.
2. Сформулировать 24 вопроса.
3. Разложить модели по уровням reasoning effort — получится сетка сочетаний.
4. Подключить источник через MCP и прогнать вопросы по нему.
5. Считать не только качество ответов, но и стоимость прогона.
Статья 1089876 на Habr — там вся методика
🤖 Интересуют ИИ-агенты и автоматизация?
Промпты для сборки ИИ-агентов и автоматизаций — читай по теме:
🔗 Вся библиотека промптов · Категория «ИИ-агенты»
Готовый продукт по теме: 50 промптов для ChatGPT, которые экономят 10+ часов в неделю — забрать и применить сразу.