← Все статьи

Какую LLM выбрать — методика своего бенчмарка на 24 вопросах по рабочим данным

· Источник: оригинал

🛠️ Свой бенчмарк на 24 вопросах: как выбрать LLM под рабочие данные

Публичные рейтинги не показывают, как модель справится с конкретными задачами и сколько это будет стоить. На Habr вышла методика ровно про это — статья 1089876.

Задача — выбрать LLM под живой электронный лабораторный журнал, то есть базу данных экспериментов и измерений.

Что прогоняли: 24 вопроса по этому журналу на DeepSeek, ChatGPT и Claude. В тесте — 19 сочетаний «модель + уровень усилий при рассуждении» (reasoning effort). Всего примерно 450 прогонов.

Запуск вопросов по живому журналу шёл через MCP — прямо по рабочей базе. Дата оценки актуальности материалов в дайджесте — 04 October 2026.

Пошагово под свою задачу:
1. Взять свой рабочий массив данных — здесь в этой роли лабораторный журнал.
2. Сформулировать 24 вопроса.
3. Разложить модели по уровням reasoning effort — получится сетка сочетаний.
4. Подключить источник через MCP и прогнать вопросы по нему.
5. Считать не только качество ответов, но и стоимость прогона.

Статья 1089876 на Habr — там вся методика

🤖 Интересуют ИИ-агенты и автоматизация?

Промпты для сборки ИИ-агентов и автоматизаций — читай по теме:

🔗 Вся библиотека промптов · Категория «ИИ-агенты»

Готовый продукт по теме: 50 промптов для ChatGPT, которые экономят 10+ часов в неделю — забрать и применить сразу.

AIАвтоматизация

🎁 Забери бесплатный набор AI-промптов

6 отобранных промптов для бизнеса, кода и контента + доступ к библиотеке 2000+. Без оплаты.

✈️ Получить набор в Telegram

Нужны готовые автоматизации для вашего бизнеса?

Смотреть продукты