I work at Tencent AI Lab
as a research scientist now in Shenzhen.
I completed my master’s degree at Tsinghua University (SIGS, 2021/09 - 2024/06) under the supervision of Prof. Yujiu Yang in the Intelligent Interaction Group. Previously, I earned my bachelor’s degree from Wuhan University (2017/09 - 2021/06).
Research
I am generally interested in natural language processing and machine learning. Current interests include:
- Effective Model Architecture
- Ultra-Long Context Memory
- Reinforcement Learning
Selected Papers
* denotes co-first authors, $^\dagger$ denotes corresponding author/main advisor
Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate
Tian Liang*, Zhiwei He*, Wenxiang Jiao*, Xing Wang$^\dagger$, Yan Wang, Rui Wang, Yujiu Yang$^\dagger$, Zhaopeng Tu, Shuming Shi
EMNLP 2024. [arxiv] [code] [bib]
- Pioneer of Multi-Agent LLM, Citations: 1,500+, Github Stars: 600+
DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
Zhiwei He*, Tian Liang*, Jiahao Xu*, Qiuzhi Liu, Xingyu Chen, Yue Wang, Linfeng Song, Dian Yu, Zhenwen Liang, Wenxuan Wang, Zhuosheng Zhang, Rui Wang$^\dagger$, Zhaopeng Tu$^\dagger$, Haitao Mi, Dong Yu
In submission to Neurips 2025. [arxiv] [code] [bib]
- Top-1 dataset @ HF with 100K+ downloads, Github Stars: 300+
Do NOT Think That Much for 2+3=? On the Overthinking of Long Reasoning Models
Xingyu Chen*, Jiahao Xu*, Tian Liang*, Zhiwei He*, Jianhui Pang, Dian Yu, Linfeng Song, Qiuzhi Liu, Mengfei Zhou, Zhuosheng Zhang, Rui Wang$^\dagger$, Zhaopeng Tu$^\dagger$, Haitao Mi, Dong Yu
ICML 2025. [arxiv] [code] [bib]
- Adopted by Kimi-1.5, Citations: 600+
Thoughts Are All Over the Place: On the Underthinking of Long Reasoning Models
Yue Wang*, Qiuzhi Liu*, Jiahao Xu*, Tian Liang*, Xingyu Chen, Zhiwei He, Linfeng Song, Dian Yu, Juntao Li, Zhuosheng Zhang, Rui Wang, Zhaopeng Tu$^\dagger$, Haitao Mi, Dong Yu
Neurips 2025. [arxiv] [bib]
- NeurIPS 2025 Spotlight, Citations: 200+
DeepCompress: A Dual Reward Strategy for Dynamically Exploring and Compressing Reasoning Chains
Tian Liang$^\dagger$, Wenxiang Jiao, Zhiwei He, Jiahao Xu, Haitao Mi, Dong Yu
ICLR 2026. [arxiv] [code] [bib]
Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM’s Reasoning Capability
Zicheng Lin*, Tian Liang*, Jiahao Xu*, Qiuzhi Liu, Xing Wang, Ruilin Luo, Chufan Shi, Siheng Li, Yujiu Yang$^\dagger$, Zhaopeng Tu$^\dagger$
ICML 2025. [arxiv] [code] [bib]
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
Xiaoyuan Liu, Tian Liang, Zhiwei He, Jiahao Xu, Wenxuan Wang, Pinjia He$^\dagger$, Zhaopeng Tu$^\dagger$, Haitao Mi, Dong Yu
Neurips 2025. [arxiv] [code] [bib]
Addressing Entity Translation Problem via Translation Difficulty and Context Diversity
Tian Liang, Xing Wang$^\dagger$, Mingming Yang, Yujiu Yang$^\dagger$, Shuming Shi, Zhaopeng Tu
ACL 2024. [paper] [code] [bib]
Exploring Human-Like Translation Strategy with Large Language Models
Zhiwei He*, Tian Liang*, Wenxiang Jiao, Zhuosheng Zhang, Yujiu Yang, Rui Wang$^\dagger$, Zhaopeng Tu$^\dagger$, Shuming Shi, Xing Wang
TACL 2023. [arxiv] [code] [bib]
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
Zicheng Lin*, Zhibin Gou*, Tian Liang, Ruilin Luo, Haowei Liu, Yujiu Yang$^\dagger$
ACL 2024. [arxiv] [code] [bib]
Competition
Acronym extraction with hybrid strategies
SDU@ AAAI-22, Rank 2nd.
Siheng Li*, Cheng Yang*, Tian Liang*, Xinyu Zhu, Chengze Yu, Yujiu Yang$^\dagger$
AAAI 2022 Workshop. [paper] [code] [bib]
Multilingual Acronym Disambiguation with Multi-choice Classification
SDU@ AAAI-22, Rank 4th.
Xinyu Zhu*, Chengze Yu*, Siheng Li, Tian Liang, Cheng Yang, Yujiu Yang$^\dagger$
AAAI 2022 Workshop. [paper] [code] [bib]
