Minheng Ni

Research Assistant Professor · The Hong Kong Polytechnic University

profile.png

I received my Ph.D. in Computer Science from The Hong Kong Polytechnic University in 2026, under the supervision of Prof. Wangmeng Zuo and Prof. Lei Zhang. Previously, I received my B.Eng. in Computer Science from Harbin Institute of Technology in 2022. From 2020 to 2026, I also conducted research at Microsoft AI Superintelligence and Microsoft Research Asia, where I worked with Dr. Lijuan Wang, Dr. Zhengyuan Yang, Dr. Zicheng Liu, and Dr. Nan Duan. My research focuses on the reasoning and cognition of large multimodal models, with interests in responsible AI, multimodal reasoning, and AI for social science.

For research discussions and collaboration, please get in touch.

publications

Papers and preprints are listed in reverse chronological order. Visit my Google Scholar profile for the latest citation record.

2026

  1. BDS
    Becoming the “Post-Reality”: AIGC, Memory Generation, and an Experimental Foray into AI Anthropology
    Ennan Wu and Minheng Ni*
    Big Data & Society, 2026
  2. arXiv
    ComBodied Agents: A New Paradigm of Human-Centric Agentic AI
    Qianggang Ding, Xingyao Wang, Rui Feng, Zhibin Wang, Feixiang Yao, Kelong Mao, Hao Sun, Zhiyao Luo, Jiankai Tang, Lei Li, Jiadong Guo, Minheng Ni, Weicong Lin, Chenxi Yang, Hongxiang Gao, Zhenghua Chen, Yang Bai, Min Wu, Jun Cheng, Huazhu Fu, Dacheng Tao, and Bang Liu
    arXiv preprint arXiv:2608.10915, 2026
  3. SCIS
    Ref-Diff: Zero-Shot Referring Image Segmentation with Generative Models
    Minheng Ni, Yabo Zhang, Kailai Feng, Xiaoming Li, Yiwen Guo, and Wangmeng Zuo
    Science China Information Sciences, 2026
  4. arXiv
    Beyond Captions: Context-Grounded Reconstruction for Biomedical Multimodal Continued Pretraining
    Guanghao Zhu, Zeyu Liu, Zhitian Hou, Pengkai Wang, Zhijie Sang, Yang Yu, Minheng Ni, Wenjun Wang, Yanggan Gu, Shuo Cai, Congkai Xie, Jianmin Wu, and Hongxia Yang
    arXiv preprint arXiv:2606.01049, 2026
  5. arXiv
    CoEditor++: Instruction-Based Visual Editing via Cognitive Reasoning
    Minheng Ni, Yutao Fan, Zhengyuan Yang, Yeli Shen, Yuxiang Wei, Yaowen Zhang, Lijuan Wang, Lei Zhang, and Wangmeng Zuo
    arXiv preprint arXiv:2603.05518, 2026

2025

  1. arXiv
    TechImage-Bench: Rubric-Based Evaluation for Technical Image Generation
    Minheng Ni, Zhengyuan Yang, Yaowen Zhang, Linjie Li, Chung-Ching Lin, Kevin Lin, Zhendong Wang, Xiaofei Wang, Shujie Liu, Lei Zhang, Wangmeng Zuo, and Lijuan Wang
    arXiv preprint arXiv:2512.12220Originally released as ProImage-Bench. , 2025
  2. arXiv
    ResponsibleRobotBench: Benchmarking Responsible Robot Manipulation Using Multi-Modal Large Language Models
    Lei Zhang, Ju Dong, Kaixin Bai, Minheng Ni, Zoltan-Csaba Marton, Zhaopeng Chen, and Jianwei Zhang
    arXiv preprint arXiv:2512.04308, 2025
  3. NeurIPS
    MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM
    Bowen Dong, Minheng Ni, Zitong Huang, Guanglei Yang, Wangmeng Zuo, and Lei Zhang
    In Advances in Neural Information Processing Systems, 2025
  4. NeurIPS
    Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
    Minheng Ni, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Kevin Lin, Wangmeng Zuo, and Lijuan Wang
    In Advances in Neural Information Processing Systems, 2025
  5. RA-L
    Don’t Let Your Robot Be Harmful: Responsible Robotic Manipulation via Safety-as-Policy
    Minheng Ni, Lei Zhang, Zihan Chen, Kaixin Bai, Zhaopeng Chen, Jianwei Zhang, Lei Zhang, and Wangmeng Zuo
    IEEE Robotics and Automation Letters, 2025
  6. ICLR
    Visual-O1: Understanding Ambiguous Instructions via Multi-Modal Multi-Turn Chain-of-Thoughts Reasoning
    Minheng Ni, Yutao Fan, Lei Zhang, and Wangmeng Zuo
    In International Conference on Learning Representations, 2025
  7. arXiv
    Measurement of LLM’s Philosophies of Human Nature
    Minheng Ni, Ennan Wu, Zidong Gong, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Kevin Lin, Lijuan Wang, and Wangmeng Zuo
    arXiv preprint arXiv:2504.02304, 2025
  8. COLING
    FineRAG: Fine-Grained Retrieval-Augmented Text-to-Image Generation
    Huaying Yuan, Ziliang Zhao, Shuting Wang, Shitao Xiao, Minheng Ni, Zheng Liu, and Zhicheng Dou
    In Proceedings of the International Conference on Computational Linguistics, 2025

2024

  1. ECCV
    Responsible Visual Editing
    Minheng Ni, Yeli Shen, Lei Zhang, and Wangmeng Zuo
    In European Conference on Computer Vision, 2024
  2. arXiv
    AutoDirector: Online Auto-Scheduling Agents for Multi-Sensory Composition
    Minheng Ni, Chenfei Wu, Huaying Yuan, Zhengyuan Yang, Ming Gong, Lijuan Wang, Zicheng Liu, Wangmeng Zuo, and Nan Duan
    arXiv preprint arXiv:2408.11564, 2024
  3. ICME
    Multi-Attentional Distance for Zero-Shot Classification with Text-to-Image Diffusion Model
    Kailai Feng, Minheng Ni, Jiaxiu Jiang, Zhilu Zhang, and Wangmeng Zuo
    In IEEE International Conference on Multimedia and Expo, 2024
  4. ICML
    StrokeNUWA: Tokenizing Strokes for Vector Graphic Synthesis
    Zecheng Tang, Chenfei Wu, Zekai Zhang, Minheng Ni, Shengming Yin, Yu Liu, Zhengyuan Yang, Lijuan Wang, Zicheng Liu, Juntao Li, and Nan Duan
    In Proceedings of the International Conference on Machine Learning, 2024
  5. AAAI
    ORES: Open-Vocabulary Responsible Visual Synthesis
    Minheng Ni, Chenfei Wu, Xiaodong Wang, Shengming Yin, Lijuan Wang, Zicheng Liu, and Nan Duan
    In Proceedings of the AAAI Conference on Artificial Intelligence, 2024

2023

  1. IJCAI
    Learning 3D Photography Videos via Self-Supervised Diffusion on Single Images
    Xiaodong Wang, Chenfei Wu, Shengming Yin, Minheng Ni, Jianfeng Wang, Linjie Li, Zhengyuan Yang, Fan Yang, Lijuan Wang, Zicheng Liu, Yuejian Fang, and Nan Duan
    In Proceedings of the International Joint Conference on Artificial Intelligence, 2023
  2. ACL
    NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation
    Shengming Yin, Chenfei Wu, Huan Yang, Jianfeng Wang, Xiaodong Wang, Minheng Ni, Zhengyuan Yang, Linjie Li, Shuguang Liu, Fan Yang, Jianlong Fu, Gong Ming, Lijuan Wang, Zicheng Liu, Houqiang Li, and Nan Duan
    In Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics, 2023
  3. CVPR
    NÜWA-LIP: Language Guided Image Inpainting with Defect-Free VQGAN
    Minheng Ni, Xiaoming Li, and Wangmeng Zuo
    In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2023
  4. ICLR
    ImaginaryNet: Learning Object Detectors without Real Images and Annotations
    Minheng Ni, Zitong Huang, Kailai Feng, and Wangmeng Zuo
    In International Conference on Learning Representations, 2023

2022

  1. TALLIP
    Multi-Domain Spoken Language Understanding Using Domain-and Task-Aware Parameterization
    Libo Qin, Fuxuan Wei, Minheng Ni, Yue Zhang, Wanxiang Che, Yangming Li, and Ting Liu
    ACM Transactions on Asian and Low-Resource Language Information Processing, 2022

2021

  1. CVPR
    M3P: Learning Universal Representations via Multitask Multilingual Multimodal Pre-Training
    Minheng Ni, Haoyang Huang, Lin Su, Edward Cui, Taroon Bharti, Lijuan Wang, Dongdong Zhang, and Nan Duan
    In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2021
  2. AAAI
    Co-GAT: A Co-Interactive Graph Attention Network for Joint Dialog Act Recognition and Sentiment Classification
    Libo Qin, Zhouyang Li, Wanxiang Che, Minheng Ni, and Ting Liu
    In Proceedings of the AAAI Conference on Artificial Intelligence, 2021
  3. TASLP
    Knowing Where to Leverage: Context-Aware Graph Convolutional Network with an Adaptive Fusion Layer for Contextual Spoken Language Understanding
    Libo Qin, Wanxiang Che, Minheng Ni, Yangming Li, and Ting Liu
    IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2021

2020

  1. IJCAI
    CoSDA-ML: Multi-Lingual Code-Switching Data Augmentation for Zero-Shot Cross-Lingual NLP
    Libo Qin, Minheng Ni, Yue Zhang, and Wanxiang Che
    In Proceedings of the International Joint Conference on Artificial Intelligence, 2020
  2. AAAI
    DCR-Net: A Deep Co-Interactive Relation Network for Joint Dialog Act Recognition and Sentiment Classification
    Libo Qin, Wanxiang Che, Yangming Li, Minheng Ni, and Ting Liu
    In Proceedings of the AAAI Conference on Artificial Intelligence, 2020

academic service & community

Conference

  • AAAI Student Committee: founding member, 2024-2025.
  • AAAI AI Hackathon Track: chair/organizer, 2025.
  • Program committee: ICML, ICLR, NeurIPS, AAAI, AISTATS, CVPR, ECCV, ICCV, ACM Multimedia, ACL, EMNLP, ICRA.

Journal

  • Humanities and Social Sciences Communications
  • IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)
  • International Journal of Computer Vision (IJCV)
  • IEEE Transactions on Multimedia (TMM)
  • Science China Information Sciences (SCIS)