Qwen3.8-27B разогнали на двух RTX 3060 до 40 токенов/с при контексте 128K
· Источник: оригинал
🖥️ Qwen3.8-27B: 40 токенов/с при контексте 128K на двух RTX 3060
Задача — поднять локальный backend для OpenCode на старом железе. Платформа Z97, в слотах две RTX 3060 по 12 ГБ каждая. Модель — Qwen3.8-27B: без уменьшения модели и без отказа от 128K контекста.
Стартовая скорость на длинном контексте — 9 токенов/с. Итоговая — около 40 токенов/с в реальной агентной сессии, где контекст шёл за 100K.
Что зашло в конфиг:
— tensor split без CUDA P2P;
— Q8 KV-cache;
— встроенный MTP;
— подбор n-max.
Эксперименты с NCCL и shared buffers результата не дали.
Скорость проверяли не в вакууме: реальные long-context тесты и проверка качества на coding-задачах.
Конфиг и результаты замеров собраны в статье на Habr
🤖 Интересуют ИИ-агенты и автоматизация?
Промпты для сборки ИИ-агентов и автоматизаций — читай по теме:
- Context7 Documentation Expert Agent
- Multi-Agent Coding Workflow & Implementation Prompt Generator
- Backend Architect
🔗 Вся библиотека промптов · Категория «ИИ-агенты»
Готовый продукт по теме: Prompts for Programmers — забрать и применить сразу.