Image default
Нейросети

Российская музыкальная ИИ-модель обошла Suno v6 в слепом тесте

GPTunneL выпустил Grom Zvuk — модель для генерации музыки с вокалом, аранжировкой и сведением. В слепом тесте она набрала 83 балла из 100 за звучание против 80 у Suno v6.Автор Hi-Tech Mail

Российский разработчик GPTunneL выпустил Grom Zvuk — новую модель для генерации музыки. Как сообщили Hi-Tech Mail в компании, она создает готовые треки продолжительностью до четырех минут: с вокалом, мелодией, аранжировкой и сведением. Полученный файл в формате MP3 можно сразу использовать в ролике или публикации без дополнительной обработки в аудиоредакторе.

Разработчики сравнили Grom Zvuk с зарубежными конкурентами в слепом тесте на 150 треках на разных языках. В тестах приняли участие 150 пользователей платформы GPTunneL. Три четверти промптов взяли из открытого набора WildSongBench, названия моделей участникам не раскрывали. Композиции оценивались по двум параметрам — качество звучания и соответствие заданному тексту — с итоговой шкалой от 0 до 100. Grom Zvuk получила 83 балла за звучание и 85 за точность текста. Для сравнения: Suno v6 набрала 80 и 85, Suno v5.5 — 82 и 82, Suno v5 — 88 и 90, Mureka 9 — 90 и 78.

Модель содержит около 5 млрд параметров. Архитектурно она состоит из двух компонентов: планировщика, который определяет структуру будущей песни целиком — расположение интро, куплетов, припевов, — и синтезатора, который уточняет звучание сразу по всей длине трека, а не фрагмент за фрагментом. Эти компоненты связаны механизмом гибридного самовнимания, а на финальном этапе декодер формирует стереозапись. По словам разработчика, такой подход обеспечивает связность между частями и единое звучание на протяжении всей песни. Промежуточного результата для прослушивания нет: трек становится доступен только после завершения расчета целиком. Генерация занимает около 30 секунд в зависимости от нагрузки.

Читать далее:
Нейросети значительно охотнее человека готовы помочь с финансами

Помимо создания оригинальных композиций по описанию стиля и настроения, Grom Zvuk поддерживает инструментальные треки без вокала и каверы. При создании кавера сохраняются мелодия и текст исходной песни, а аранжировка, инструменты и манера вокала меняются под заданный жанр. Модель поддерживает вокал на русском, английском, китайском, японском, казахском, испанском, немецком, французском и корейском языках; список разработчик называет открытым. Результаты генерации остаются у пользователя, однако GPTunneL не берет на себя ответственность за соблюдение авторских прав при создании каверов.

Доступ к Grom Zvuk будет открыт через API GPTunneL. Тарификация не привязана к объему данных: оплачивается готовая песня. На старте одна генерация стоит 1 рубль, до конца 2026 года цена вырастет до 4 рублей. Для корпоративных клиентов объемы и условия нагрузки определяются отдельно. Модель работает на собственной вычислительной инфраструктуре GPTunneL.

Похожие записи

В России введут «гибкое» регулирование ИИ

admin

Как попасть в ИИ-ответ поисковика: почему первой страницы уже недостаточно

admin

Anthropic выпустила Claude Fable 5: урезанная версия «опасного ИИ» Mythos

admin