Диффузионная модель text-to-music на 3.5B. Генерирует песню целиком, с вокалом, по описанию; 19 языков.