← Все статьи

Qwen3.8-27B разогнали на двух RTX 3060 до 40 токенов/с при контексте 128K

· Источник: оригинал

🖥️ Qwen3.8-27B: 40 токенов/с при контексте 128K на двух RTX 3060

Задача — поднять локальный backend для OpenCode на старом железе. Платформа Z97, в слотах две RTX 3060 по 12 ГБ каждая. Модель — Qwen3.8-27B: без уменьшения модели и без отказа от 128K контекста.

Стартовая скорость на длинном контексте — 9 токенов/с. Итоговая — около 40 токенов/с в реальной агентной сессии, где контекст шёл за 100K.

Что зашло в конфиг:

— tensor split без CUDA P2P;

— Q8 KV-cache;

— встроенный MTP;

— подбор n-max.

Эксперименты с NCCL и shared buffers результата не дали.

Скорость проверяли не в вакууме: реальные long-context тесты и проверка качества на coding-задачах.

Конфиг и результаты замеров собраны в статье на Habr

🤖 Интересуют ИИ-агенты и автоматизация?

Промпты для сборки ИИ-агентов и автоматизаций — читай по теме:

🔗 Вся библиотека промптов · Категория «ИИ-агенты»

Готовый продукт по теме: Prompts for Programmers — забрать и применить сразу.

AIАвтоматизация

🎁 Забери бесплатный набор AI-промптов

6 отобранных промптов для бизнеса, кода и контента + доступ к библиотеке 2000+. Без оплаты.

✈️ Получить набор в Telegram

Нужны готовые автоматизации для вашего бизнеса?

Смотреть продукты