MiniMax открыла для скачивания веса музыкальной модели Music 3. Она генерирует законченную песню по тексту и подробному описанию аранжировки, сохраняет результат в стереофонический WAV и может работать на пользовательском компьютере. В Telegram новость разошлась в более эффектной версии: якобы модель пишет композиции длиной до десяти минут и является полностью открытым исходным проектом. Официальная карточка этого не подтверждает.
Максимальная заявленная продолжительность одной песни составляет пять минут. Модель принимает отдельно текст песни и музыкальное задание: жанр, темп, тональность, характер вокала, инструменты и развитие аранжировки. На выходе получается WAV с частотой 32 кГц, глубиной 16 бит и двумя каналами.
Как устроена MiniMax Music 3
За общую структуру отвечает языковая модель на 8 миллиардов параметров. Она следит за темами, ритмом и развитием песни на длинном отрезке. Локальная модель на 600 миллионов параметров восстанавливает акустические детали внутри каждого фрагмента.
После этого скрытые состояния двух моделей поступают в модуль Flow Matching на 2,4 миллиарда параметров и декодер Flow-VAE. Такая схема должна удерживать голос, инструменты и композиционную логику от вступления до финала, а не собирать трек из плохо связанных коротких кусков.
Пользователь может размечать в тексте вступление, куплет, припев, бридж, соло и концовку. Разработчики сразу предупреждают: это управление, а не нотная партитура. Темп, тональность, состав инструментов и даже слова могут соблюдаться не идеально.
Какое железо потребуется
Обычная конфигурация рассчитана на видеокарту Nvidia и CUDA. В полной точности модель помещается в 24 ГБ видеопамяти. Автоматическая выгрузка части компонентов в оперативную память снижает потребление примерно до 22 ГБ.
Разработчики описали и режим для видеокарт с 8 ГБ памяти. В нем слои языковой модели поочередно переносятся между процессором и GPU. Запуск становится заметно медленнее, поэтому формулировка «работает на любом домашнем компьютере» была бы слишком смелой. Поддержка Apple Silicon и обычного процессора в разделе ограничений не заявлена.
Можно ли называть модель открытой
Файлы модели действительно доступны на Hugging Face, их можно скачать и запускать локально. Однако на момент проверки в карточке не была указана явная лицензия. Открытые веса и открытый исходный код не являются одним и тем же, а отсутствие лицензии не дает автоматического права на коммерческое использование и распространение производных версий.
Не подтверждена и отдельная поддержка русского языка. В примерах есть английские тексты, а архитектура может обрабатывать и другие языки, но это еще не гарантия чистого произношения и стабильного вокала на русском. Такой вывод требует отдельного теста.
MiniMax Music 3 интересна не обещанием заменить музыканта одной кнопкой. Важнее то, что тяжелая модель стала скачиваемым инструментом с воспроизводимыми параметрами запуска. Но ее реальные пределы скромнее вирусного пересказа: до пяти минут, CUDA, существенные требования к памяти и неясный лицензионный режим.
