StepAudio 3 Gen — одна модель для TTS, дизайна голоса, музыки и звуковых эффектов
· Источник: оригинал
⚡ StepFun выкатили StepAudio 3 Gen — универсальная генерация аудио без diffusion
StepFun зарелизили general-purpose модель генерации аудио и собрали все аудиозадачи в один фреймворк. StepAudio 3 Gen закрывает zero-shot text-to-speech, дизайн голоса, генерацию вокала, звуковые эффекты, музыку, vibe speech и гибридные миксы нескольких аудиотипов — всё одной моделью, а не набором отдельных инструментов под каждый тип звука.
Под капотом — дискретный авторегрессионный генератор, который моделирует аудио напрямую поверх RVQ-токенов (residual vector quantization — остаточное векторное квантование). Это отход от парадигмы diffusion Transformer-based continuous generation, на которой стоит большинство современных general audio моделей: вместо continuous-диффузии — discrete autoregressive.
За сжатие аудио отвечает StepAudio Tokenizer: общее представление аудио с частотой 12.5 Hz в общем пространстве 16 × 2048.
Всё это описано в StepAudio 3 Gen Technical Report на HuggingFace Papers — huggingface.co/papers/2609.12945
🎬 Работаешь с видео и мультимедиа?
Промпты для видео и мультимедиа-сценариев — в тему:
- Ultimate Seedance 2.0 Prompt Engineering
- Module Wrap-Up & Next Steps Video Generation
- New Year Celebration Video for Antioch Textile
🔗 Вся библиотека промптов · Категория «Видео»
Готовый продукт по теме: AI Image Prompt Pack — забрать и применить сразу.