Zhuang, Xiaobin

3 publications

ICML 2025 DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation Dongya Jia, Zhuo Chen, Jiawei Chen, Chenpeng Du, Jian Wu, Jian Cong, Xiaobin Zhuang, Chumin Li, Zhen Wei, Yuping Wang, Yuxuan Wang

ICML 2025 Sounding That Object: Interactive Object-Aware Image to Audio Generation Tingle Li, Baihe Huang, Xiaobin Zhuang, Dongya Jia, Jiawei Chen, Yuping Wang, Zhuo Chen, Gopala Anumanchipalli, Yuxuan Wang

NeurIPSW 2024 Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions Yi Yuan, Dongya Jia, Xiaobin Zhuang, Yuanzhe Chen, Zhengxi Liu, Zhuo Chen, Yuping Wang, Yuxuan Wang, Xubo Liu, Xiyuan Kang, Mark D Plumbley, Wenwu Wang