Связаться со мной
Статьи
пианистка json

Что вместо Suno — MiniMax или ACE-Step

Кейс о том, как выбирать AI-инструмент не по рейтингу «кто лучше», а по конкретной производственной задаче, имеющемуся оборудованию и возможности встроить модель в рабочий процесс.

В этой статье вы узнаете:

  • Почему мне не нужен сторонний сервис
  • Почему модель весит несколько гигабайт, а просит в разы больше памяти
  • Почему вообще все требуют видеокарту
  • Почему мощная модель может стать неудобным кандидатом
  • Как выглядит матрица выбора модели
  • Как перестать каждый раз сочинять новые промпты
  • Чем мой музыкальный кейс помогает в выборе ИИ для бизнеса.

Я довольно долго использовал Suno как инструмент создания саундтреков к моим видео. И знаю много людей, которых Suno буквально спасал от страйков по поводу фоновой музыки.

Но у облачных генераторов есть пакостное свойство: сегодня сервис дешёвый и щедрый, завтра хряп — закончились все кредиты, послезавтра меняются тарифы или правила — и кусок твоего производственного процесса внезапно тебе больше не принадлежит.

Поэтому мне стало интересно: а нельзя ли вообще убрать музыкальную генерацию с чужого сервиса и делать её локально?

Open-weight-модели для генерации музыки уже есть. Два особенно интересных кандидата сейчас — в августе 2026-го — MiniMax Music 3 и ACE-Step 1.5.

Эта статья — не отчёт о собственном сравнительном тестировании. Я не устанавливал обе модели и не прогонял через них одинаковый набор заданий. Это разбор инженерного выбора по документации и опубликованным тестам.

То есть, я выбираю не «лучшую музыкальную нейросеть вообще», а первого кандидата на внедрение в конкретной конфигурации.

Мне не нужен локальный Suno

Я просто хочу делать управляемую музыку для видео: 40 секунд не мешать голосу, потом на семь секунд выйти на первый план и поставить эмоциональную точку.

Для моей задачи модель должна:

  • запускаться локально на Apple Silicon с 24 ГБ объединённой памяти;
  • генерировать инструментальную музыку нужной продолжительности;
  • позволять управлять характером и развитием композиции;
  • иметь программный интерфейс для будущей автоматизации;
  • не превращать установку и эксплуатацию в самостоятельный IT-проект;
  • давать результат, достаточный для подложки и короткого музыкального финала, а не для сведённого альбома.

Почему модель весит всего несколько гигабайт, но просит дофигищи памяти?

Когда смотришь на размер скачиваемой модели, думаешь: ой какая маленькая!

У меня Mac на Apple M5 с 24 ГБ объединённой памяти. Файл на несколько гигабайт туда прекрасно помещается. Почему бы просто не запустить?

Потому что размер модели на диске и память, необходимая для генерации, — разные вещи.

На диске в основном лежат веса модели. Во время генерации к ним добавляются промежуточные вычисления, состояния нейросети, декодирование аудио и другие части рабочего контура.

Модель, грубо говоря, разбухает как китайский чай.

Что занимает памятьЗачем это нужно
Веса моделиСобственно обученная нейросеть
АктивацииПромежуточные результаты вычислений
Состояние языковой моделиПланирование структуры музыки
Аудиодекодер / VAEПревращение внутреннего представления в звук
Рабочая памятьОбслуживание самой генерации

Именно поэтому файл на 8–10 ГБ совершенно не означает: «у меня есть 10 ГБ свободной оперативной памяти — значит, всё полетит».

Почему вообще все требуют видеокарту?

Современные генеративные модели состоят из огромного количества матричных операций. Центральный процессор их тоже умеет выполнять. Проблема не в возможности, а в скорости.

Графический процессор способен выполнять огромное количество таких операций параллельно. Поэтому фраза «для модели нужна видеокарта» чаще означает не «без неё невозможно», а «без подходящего ускорителя ждать придётся слишком долго».

Но здесь есть важное исключение — Apple Silicon.

В обычном PC оперативная память и видеопамять разделены:

32 ГБ оперативной памяти + 12 ГБ видеопамяти ≠ 44 ГБ памяти для модели.

Модель, которую мы хотим быстро считать на графическом процессоре, должна в значительной степени помещаться именно в видеопамяти.

У Apple немного другая архитектура: центральный и графический процессоры используют общую объединённую память.

Поэтому мои 24 ГБ на M5 — интересная конфигурация именно для локального AI. Не сервер. Не RTX 5090. Но уже вполне серьёзная локальная AI-машина для некоторых классов задач.

MiniMax Music 3: мощная модель, неудобный первый кандидат

MiniMax Music 3 технически очень интересна.

Global LLM — ~8B. Большая языковая модель примерно на 8 млрд параметров. Она играет роль «композитора/режиссёра»: смотрит на весь текст песни, промпт со стилем, структуру и понимает общую музыкальную драматургию — где куплет, где припев, как должна развиваться композиция.

Local LLM — ~0.6B. Это маленькая языковая модель на 600 млн параметров. Она скорее «исполнитель текущего фрагмента». Ей не нужно каждый момент заново осмысливать всю песню. Большая модель задала глобальный план, маленькая занимается локальными музыкальными событиями.

Получается примерно:

Global 8B: «Что мы вообще сейчас играем?» ↓ Local 0.6B: «Что конкретно происходит вот здесь?» ↓ Звуковая модель: «Как это физически должно звучать?»

Flow Matching и Flow-VAE занимаются непосредственно генерацией звуковой волны — голоса, гитары, барабанов, рояля и т. д.

VAE работает с компактным внутренним представлением аудио вместо обработки каждой точки WAV напрямую, а Flow Matching создаёт это представление.

Если собрать схему вместе, MiniMax Music 3 использует большую модель для общего плана композиции, маленькую — для текущего музыкального фрагмента, а отдельный звуковой модуль превращает этот план в аудио. На выходе получается стереофайл WAV с частотой 32 кГц; заявленная продолжительность композиции — до пяти минут.

И вот тут начинается проблема.

Официальный локальный запуск MiniMax Music 3 использует два графических процессора с CUDA. Первый последовательно строит музыкальный план — это называется авторегрессионной генерацией. Второй превращает план в звуковую волну.

MiniMax Music 3Ситуация
NVIDIA / CUDAОсновная среда запуска
Несколько графических процессоровПоддерживаются официальным способом запуска
Windows/Linux + NVIDIAЛогичный вариант
Apple SiliconЕсть альтернативные реализации, но это не основной официальный путь
M5 / 24 ГБИсследовательский эксперимент, а не очевидная производственная ставка

Это не значит, что MiniMax плох. Это значит, что его сильные стороны плохо совпадают с моей исходной конфигурацией и желанием быстро получить рабочий инструмент.

MiniMax Music 3 я оставляю в списке наблюдения.

Мне сейчас нужна музыка, а не ещё один IT-проект.

ACE-Step 1.5: более подходящий кандидат

ACE-Step 1.5 гораздо лучше совпадает с моей задачей.

Для меня важнее другое: ACE-Step умеет работать на Mac без экзотических обходных путей.

Основные музыкальные вычисления выполняются в PyTorch. Чтобы PyTorch мог использовать графический процессор Mac, он обращается к системной технологии Apple — Metal Performance Shaders, или MPS.

Языковую часть можно запустить через MLX — инструмент Apple, специально рассчитанный на машинное обучение в архитектуре Apple Silicon.

ACE-Step сам распознаёт Apple Silicon, учитывает объединённую память и рекомендует MLX для языковой модели. Разработчики также предупреждают: перенос части вычислений с видеокарты на центральный процессор — offloading — на Mac не даёт той же выгоды, что на компьютере с отдельной видеопамятью.

По заявленным требованиям, упрощённому режиму только со звуковой диффузионной моделью нужно примерно 4 ГБ памяти. Режиму с дополнительной языковой моделью — около 6 ГБ. Основные файлы моделей занимают примерно 10 ГБ на диске.

Это ещё не доказывает, что модель будет идеально работать именно у меня. Но означает, что M5 с 24 ГБ объединённой памяти соответствует заявленному сценарию, а не используется вопреки основной архитектуре проекта.

В одной из реализаций для Apple Silicon машина с 24 ГБ памяти попадает в среднюю категорию: заявлена генерация до пяти минут и одновременная обработка до четырёх вариантов. По умолчанию используется языковая модель на 1,7 млрд параметров.

Матрица выбора для моей задачи

Ни одна строка этой таблицы не является результатом моего собственного сравнительного теста. Это предварительная матрица выбора, собранная по документации и опубликованным пользовательским опытам.

КритерийMiniMax Music 3ACE-Step 1.5
Локальная генерацияДаДа
Основной путь для Apple SiliconПока нетДа
MPSНе основной сценарийДа
MLXСторонние решенияДля языковой модели
M5 / 24 ГБЭкспериментироватьПервый кандидат
Инструментальная фоновая музыкаДаДа
Длинные композицииДо 5 минутДо 10 минут в подходящей конфигурации
API для своего софтаМожно построитьЕсть REST API
Инфраструктурное трениеВысокое для моей конфигурацииНиже
Решение сейчасНаблюдатьНачать с него

Последняя строка для меня важнее остальных.

«Плим-плим на фоне»

Фоновая музыка — самый очевидный сценарий.

Есть голос. Есть трёхминутное видео. Мне нужна музыка определённого характера, которая не лезет вперёд, оставляет место речи и заканчивается там, где заканчивается ролик.

Но у меня есть другой формат. Я делаю короткие видео — затравки к своим рассказам.

Почти весь шортс идёт голос. Под ним работает музыка. Но в финале голос заканчивается.

Музыка остаётся одна.

Последние несколько секунд она перестаёт быть фоном. Она должна выйти вперёд и эмоционально закончить сцену.

На экране в этот момент появляется:

Вы прослушали затравку из рассказа Дмитрия Слинкова «…».
Прочитать рассказ можно здесь.

То есть требуется не просто background music, а маленький саундтрек с драматургией.

ВремяГолосМузыкаЗадача
0
–0
Основной текст20–25%Не мешать рассказчику
0
–0
Финал рассказа30–40%Начать эмоциональный подъём
0
Последняя фразаПереходГолос исчезает
0
–0
70–100%Музыка выходит на первый план
0
Финальный акцентТитр / ссылка / конец

Музыка должна понимать свою роль внутри видео.

А если вообще перестать каждый раз сочинять промпты?

Не обязательно каждый раз сочинять новую музыку с нуля. Можно постепенно создать собственный музыкальный язык: не тысячу случайных треков, а несколько семейств.

  • Story / Melancholy
  • Story / Suspense
  • Story / Warm
  • Story / Absurd
  • Documentary / Technology
  • Essay / Calm
  • Essay / Dark

Дальше генерим вариации.

Более того, я вообще не хочу в перспективе каждый раз разговаривать с музыкальной моделью. У меня есть идея собственного проигрывателя, который получает задание в формате JSON.

И две идеи неожиданно соединяются. Я могу описывать не столько саму музыку, сколько её функцию в произведении:

{
  "purpose": "story_teaser",
  "duration": 52,
  "style": {
    "genre": "minimal piano electronic",
    "mood": "melancholic, slightly ironic",
    "tempo": 82
  },
  "voiceover": {
    "from": 0,
    "to": 45,
    "music_energy": 0.25,
    "foreground": false
  },
  "outro": {
    "from": 45,
    "to": 52,
    "music_energy": 0.80,
    "foreground": true,
    "ending": "resolved"
  }
}

А дальше уже мой софт решает, что с этим делать: сгенерировать новый трек, взять существующий, сделать вариацию, подогнать продолжительность или создать отдельный outro.

Возможно, со временем он сможет подбирать музыку автоматически под эмоциональную структуру текста.

Тогда получается уже не «бесплатная замена Suno», а собственный музыкальный производственный контур:

текст → голос → музыкальная драматургия → генерация → монтаж → видео.

Важно: пока это проектная схема, а не уже работающий конвейер. Но именно схема позволяет понять, какая модель подходит для следующего шага и зачем ей вообще нужен API.

Что этот музыкальный кейс говорит о выборе ИИ для бизнеса

Музыка здесь — только наглядный пример. Тот же способ выбора работает для корпоративного поиска, распознавания документов, генерации изображений, обработки звонков и внутренних AI-агентов.

1. Начинать надо не с названия модели

Вопрос «что лучше?» почти всегда слишком широкий. Сначала нужно описать действие, которое система должна выполнить, и результат, который можно проверить.

Мне нужна не «лучшая музыка», а дорожка для видео с определённой драматургией. Компании нужен не «лучший чат-бот», а, например, помощник, который находит пункт договора, показывает источник и не открывает сотруднику закрытые документы.

2. Качество — только один из критериев

Даже более сильная модель может проиграть, если требует неподходящего оборудования, не имеет API, плохо управляется или создаёт неприемлемую зависимость от поставщика.

3. Инфраструктура участвует в выборе продукта

Модель существует не в сравнительной таблице, а на конкретном компьютере, сервере или облачном тарифе. Ограничения среды могут оказаться важнее нескольких процентов в сравнительном тесте.

4. Нужно различать факт, чужой опыт и собственный вывод

Документация сообщает заявленные возможности. Пользовательские тесты показывают опыт других конфигураций. Из них можно сделать обоснованный предварительный выбор — но нельзя выдавать его за собственное испытание.

5. Выбирается не победитель, а следующий дешёвый шаг

Мой вывод не «ACE-Step победил MiniMax». Мой вывод: если я решу строить локальный музыкальный контур на этом Mac, начинать рациональнее с ACE-Step. Это более узкое утверждение — и поэтому, как говорил Ильич, архи-полезное!

Итак: MiniMax или ACE-Step?

На сегодня для моей задачи ответ простой:

ACE-Step 1.5 — первый кандидат на установку.

MiniMax Music 3 — наблюдать.

MiniMax технологически интересен. Возможно, ситуация изменится и он удобно поселится на Apple Silicon. Но сейчас официальный способ его локального запуска гораздо естественнее выглядит на мощном компьютере с несколькими видеокартами NVIDIA.

ACE-Step поддерживает технологии Apple, запускается через обычный веб-интерфейс или программно и по предварительным критериям лучше подходит для встраивания генерации музыки в собственный производственный контур.

И дело даже не в экономии на Suno.

Я хочу, чтобы текст был мой.

Голос — мой.

Видео — моё.

Музыка — тоже моя.


Что почитать и посмотреть

Ниже — документация и пользовательские тесты ACE-Step. Они нужны не для создания видимости собственного опыта, а чтобы проверить заявленные характеристики и увидеть ограничения на разных конфигурациях.

  1. Make & Modify — AI Music on Consumer GPUs: Mixed Results from ACE-Step 1.5
    https://makeandmodify.com/blog/local-ai-music-generation/

  2. Weekly ASCII — Suno級がローカルで? ACE-Step 1.5 を本気で検証
    https://weekly.ascii.jp/elem/000/004/374/4374045/

  3. MyClone — Release and test: ACE-Step 1.5
    https://jurn.link/dazposer/index.php/2026/02/04/release-and-test-ace-step-1-5/

  4. Z.Tools — ACE-Step v1.5 review: open-source AI music after Suno v5
    https://z.tools/blog/ace-step-v1-5-review

  5. AI Generation — ACE-Step 1.5: модель для локальной генерации музыки
    https://www.youtube.com/watch?v=F-koNoNgUsM

  6. Reddit / r/AIToolTesting — My experience using ACE-Step 1.5
    https://www.reddit.com/r/AIToolTesting/comments/1r0nvrz/my_experience_using_ace_step_15_opensource_model/

  7. Habr — ACE-Step 1.5 XL: локальная генерация музыки
    https://habr.com/en/articles/1020522/

Первоисточники