← Все статьи

StepAudio 3 Gen — одна модель для TTS, дизайна голоса, музыки и звуковых эффектов

· Источник: оригинал

⚡ StepFun выкатили StepAudio 3 Gen — универсальная генерация аудио без diffusion

StepFun зарелизили general-purpose модель генерации аудио и собрали все аудиозадачи в один фреймворк. StepAudio 3 Gen закрывает zero-shot text-to-speech, дизайн голоса, генерацию вокала, звуковые эффекты, музыку, vibe speech и гибридные миксы нескольких аудиотипов — всё одной моделью, а не набором отдельных инструментов под каждый тип звука.

Под капотом — дискретный авторегрессионный генератор, который моделирует аудио напрямую поверх RVQ-токенов (residual vector quantization — остаточное векторное квантование). Это отход от парадигмы diffusion Transformer-based continuous generation, на которой стоит большинство современных general audio моделей: вместо continuous-диффузии — discrete autoregressive.

За сжатие аудио отвечает StepAudio Tokenizer: общее представление аудио с частотой 12.5 Hz в общем пространстве 16 × 2048.

Всё это описано в StepAudio 3 Gen Technical Report на HuggingFace Papers — huggingface.co/papers/2609.12945

🎬 Работаешь с видео и мультимедиа?

Промпты для видео и мультимедиа-сценариев — в тему:

🔗 Вся библиотека промптов · Категория «Видео»

Готовый продукт по теме: AI Image Prompt Pack — забрать и применить сразу.

AIАвтоматизация

🎁 Забери бесплатный набор AI-промптов

6 отобранных промптов для бизнеса, кода и контента + доступ к библиотеке 2000+. Без оплаты.

✈️ Получить набор в Telegram

Нужны готовые автоматизации для вашего бизнеса?

Смотреть продукты