2025年3月,我正式进入 LLM 领域,并很快在工业界发表了多篇论文、展开了有效实践,具备较快的学习加速度。目前我是清华大学的博1学生😁. 此前我曾在蚂蚁集团担任研究型实习生,并在快手、美团入选顶级人才计划. 目前我已经有 8 篇一作/共一的学术论文被国际会议/期刊接收(6A+2B)及 2 篇技术报告,7 篇在投(截至 2026.07). 我的跨领域研究经历使我形成了从多模态生成到智能体推理的连续研究视角. 此外,我曾在北京、上海、杭州、深圳、苏州、南京等多个城市生活工作,对每座城市都有深刻的体验与感受。
我的主要研究成果均来自工业界的实习经历,涵盖智能体推理、检索增强生成、数字人动作生成、三维渲染、脑机接口等多个方向。
我的研究方向包括但不限于:
🤖 LLM 方向
- 🔍 Agentic RAG & 多跳推理(蚂蚁 + 美团实习产出)
- 🎯 LLM 推理与 RL 训练: WebFilter (AAAI26), EviNote-RAG, DAGENT, Rehearsal-RL, OneReason Tech Report
- 🛒 LLM4RAG(快手实习产出)
- 📊 对话 Agent 评测 (SAGE Benchmark): 美团实习产出
👁️ CV 方向(点击展开)
- 🕺 数字人动作生成 (Motion Generation): ICASSP24,AAAI25 👑Oral,IJCV25
- 🎨 三维渲染 (3D Rendering): ICASSP24 👑Oral
- 🧠 脑机接口交叉研究 (AI4Neuro): ICML25
我做过很多有意思的方向,学习能力很快,最后我发现学的东西实在太杂了,机缘巧合拿我当时在做的群舞模型做了一个这样的 vcr:

如果您对我的研究方向感兴趣(或者对我感兴趣)并有意向合作, 也随时欢迎联系我😆! 我非常喜欢合作, 会成为你非常好的合作伙伴!
👨👩👧👦 Internship
🏢 企业实习 (Industry)

快手 Kuaishou · 核心推荐部门 / 基模算法部门 2026.03 - 2026.06
🏅 K-Star 人才计划
📄 产出: OneReason 技术报告已公开
💼 参与快手推荐推理基座模型全流程开发:按日迭代训练与评测,使用千卡级集群协同推进,不到一个月取得行业领先结果;构建的 CoT 方案为组内唯一有效版本并被最终论文采用

美团 Meituan · 对话智能体方向 2025.08 - 2026.02
🏅 北斗人才计划
📄 产出: ACL 2026*1, ICML26*1, NeurIPS 2026 在投*1, SAGE Benchmark
💼 主导 Agentic RAG 与服务对话 Agent 研究:提出 SEAD 自进化 Agent 框架(ACL26)、DAGENT 多跳推理工作流、SAGE 服务对话评测基准

蚂蚁集团 Ant Group · 研究型实习生 2025.03 - 2025.08
🏅 研究型实习(杭州)
📄 产出: AAAI 2026*1, EMNLP 2026 在投*1, DAGENT / Rehearsal-RL 等多跳推理工作流工作
✨ 亮点: 参与的技术报告 Atom-Searcher 已公开,GitHub 获得 300+ Stars
💼 RAG + RL 方向研究:提出 WebFilter 知识过滤框架(AAAI26)、EviNote-RAG 证据笔记增强方法
🔬 科研实习 (Research)

上海人工智能实验室 Shanghai AI Lab · 浦江实验室 2024.09 - 2025.03
📍 上海 · 实习生 (Intern)
💡 产出: ICML 2025 *1

光明实验室 Guangming Laboratory 2024.06 - 2024.09
📍 深圳 · 论文合作者
💡 产出: TPAMI 2025 *1

南京大学 NJU · 苏州校区 2024.05 - 2024.08
📍 江苏苏州 · 科研助理 (RA)
💡 产出: AAAI 2025 👑Oral *1

清华大学深圳国际研究生院 SIGS 2023.04 - 2024.03
📍 深圳 · 科研助理 (RA)
💡 产出: ICASSP 2024 👑Oral *1, ICASSP 2024 *1
🔥 News
2026
- 2026.07: 🎉 DAGENT 和 Rehearsal-RL 论文公开至 arXiv!
- 2026.06: 🎉 OneReason 技术报告公开:业界首个在工业推荐场景中让 thinking 模式稳定优于 non-thinking 模式的推荐推理基座模型。
- 2026.06: 🎉 4篇一作/共一论文投稿至 EMNLP 2026!
- 2026.05: 🎉 一作论文 SEAD 被 ACL 2026 Findings 接收!
- 2026.04: 🎉 SAGE 基准论文公开至 arXiv!
- 2026.03: 🚀 加入快手 OneRec 核心团队,入选 K-Star 人才计划!
2025
2025
- 2025.12: 🎉 共一论文 GreenPlanner 被 CVPR 2026 Findings 接收!
- 2025.10: 🎉 WebFilter / LogicBench 分别被 AAAI 2026 接收(LogicBench 为 👑Oral)!
- 2025.09: 🎉 EviNote-RAG 论文公开至 arXiv!
- 2025.08: 🚀 加入美团,入选北斗人才计划!
- 2025.08: 🎉 CARD 被 EMNLP 2025 接收!
- 2025.08: 🎉 Atom-Searcher 技术报告公开至 arXiv!
- 2025.07: 🎉 RealFactBench 被 ACM MM 2025 Datasets Track 接收!
- 2025.07: 🎉 MRED-14 被 ACM MM 2025 接收为 👑Oral!
- 2025.07: 🎉 RAMA 论文公开至 arXiv,并被 WWW 2026 Workshop 接收!
- 2025.06: 🎉 TCDiff++ 论文公开至 arXiv(IJCV 2025 版本)!
- 2025.05: 🎉 MindAligner 被 ICML 2025 接收!
- 2025.05: 🎉 FloorPlan-LLaMa 被 ACL 2025 接收为 👑Oral,⭐SAC Highlight!
2024
2024
- 2024.10: 🎉 一作论文 TCDiff 被 AAAI 2025 接收为 👑Oral!
- 2024.03: 🎉 TCDiff 论文公开至 arXiv!
📝 Publications
Tech Reports(2)

[Tech Report]OneReason: A System Report on Reasoning-Enhanced LLM for Recommendation [arXiv] [机器之心] [智东西]
OneRec Team (Core Contributor, including Yuqin Dai)
- 业界首个在工业推荐场景中让 thinking 模式稳定优于 non-thinking 模式的推荐推理基座模型。
- 经历全流程模型开发:多轮 RFT、OPD、GRPO 等训练策略迭代,百卡集群训练。
- 构建的 CoT 方案被论文最终版本采用,是组内唯一有效的 CoT 版本。

[Tech Report]Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward [arXiv] [Github] [机器之心]
Yong Deng∗, Guoqing Wang∗, Zhenzhe Ying∗, Xiaofeng Wu∗, Jinzhen Lin, Wenwen Xiong, Yuqin Dai, Shuo Yang, Zhanwei Zhang, Qiwen Wang, Yang Qin, Changhua Meng
- 提出全新的”原子思维”范式:将大模型的推理过程拆解为细粒度的功能单元,从而引导模型进行更清晰、更深入的推理。
- 设计原子思维奖励机制(ATR)及课程式聚合策略:通过将 ATR 与最终结果奖励结合,缓解了策略优化中的梯度冲突和奖励稀疏问题。
- 构建 Atom-Searcher 框架并验证效果:基于原子思维与奖励聚合策略,在七个基准测试上超越现有最优方法。
一作/共一论文(15)

[ACL26 Findings]SEAD: Self-Evolving Agent for Multi-Turn Service Dialogue
Yuqin Dai, Ning Gao, Wei Zhang, Jie Wang, Zichen Luo, Jinpeng Wang, Yujie Wang, Ruiyuan Wu, Chaozheng Wang.
- 提出SEAD框架:首个面向服务对话的自进化智能体,无需大规模人工标注数据,有效解决数据稀缺与质量差的难题。
- 创新解耦机制:将用户画像控制与角色扮演分离,构建公平的对抗博弈与自适应课程学习环境,避免训练失衡。
- 性能显著领先:任务完成率提升17.6%,对话效率提升11.1%,效果显著优于现有开源基座及商业闭源模型。

[AAAI25 Oral]Harmonious Group Choreography with Trajectory-Controllable Diffusion
Yuqin Dai, Wanlu Zhu, Ronghui Li, Zeping Ren, Xiangzheng Zhou, Xiu Li, Jun Li, Jian Yang.
- 发现并提出领域内存在的问题: 舞者混淆(Dancer Ambiguity)现象. 为后续研究提供指引与思路.
- TCDiff 是当前 SOTA 的多人舞蹈生成模型, 能够较好的解决舞者混淆(Dancer Ambiguity)现象.
- 提出了 Footwork Adaptor 模块, 能有效缓解多人舞蹈生成中的脚步滑动问题(Foot Slide).
- 提出了 Fusion Projection 插件, 该插件占用较小的计算资源, 能够有效解决舞者混淆(Dancer Ambiguity)现象

[arXiv25]EviNote-RAG: Enhancing RAG Models via Answer-Supportive Evidence Notes
Yuqin Dai*, Guoqing Wang*, Yuan Wang*, Kairan Dou, Kaichen Zhou, Zhanwei Zhang, Shuo Yang, Fei Tang, Jun Yin, Pengyu Zeng, Zhenzhe Ying, Can Yi, Changhua Meng, Yuchen Zhou, Yongliang Shen, Shuai Lu
- 我们提出 EviNote-RAG 框架,将“检索-回答”模式改为“检索-笔记-回答”,提升信息提炼和推理可靠性。
- 引入类人类的检索式摘要机制,生成支持性证据笔记(SENs),突出关键信息和不确定点,减少噪音、提升聚焦。
- 方法在多个问答基准上达到 SOTA,不仅效果显著提升,还大幅增强训练稳定性和效率,例如在 HotpotQA、Bamboogle、2Wiki 上分别提升 F1 20% (+0.093)、40% (+0.151)、91% (+0.256)。

Yuqin Dai*, Shuo Yang*, Guoqing Wang*, Yong Deng, Zhanwei Zhang, Jun Yin, Pengyu Zeng, Zhenzhe Ying, Changhua Meng, Can Yi, Yuchen Zhou, Weiqiang Wang, Shuai Lu
- 我们提出了 WebFilter 框架,将检索过程建模为马尔可夫决策过程,并通过强化学习训练大语言模型使用高级网页搜索操作符,从而在真实网络环境中有效过滤虚假信息。
- 设计了信息过滤奖励策略,结合“来源限制奖励”和“检索精度奖励”,同时优化查询行为与检索结果质量,显著提高了检索精准度与可信度。
- 实验表明,WebFilter 在多项问答基准上取得了最优性能,高级搜索操作符的使用率由 10% 提升至 75%,并在域内与跨域任务中均展现出强泛化能力。

Yuqin Dai*, Wanlu Zhu*, Ronghui Li, Xiu Li, Zhenyu Zhang, Jun Li,Jian Yang
- 我们提出TCDiff++, 一种端到端版本的群舞生成模型。
- 我们引入位置嵌入和一致性损失,防止碰撞并保持合理间距。
- 模型加入换位信息和脚步自适应器,减少脚滑并提升一致性。
- 优化长时生成效果,提出长序列采样与解码器,优化长舞蹈生成的连贯性。

Yuqin Dai*, Zhouheng Yao*, Chunfeng Song, Qihao Zheng, Weijian Mai, Kunyu Peng, Shuai Lu, Wanli Ouyang, Jian Yang, Jiamin Wu.
- 我们提出了MindAligner,这是第一个显式的大脑对齐框架,能够在数据有限的情况下实现跨个体的视觉解码和大脑功能分析。
- 我们提出了一种大脑转移矩阵,用于建立不同个体之间的细粒度功能对应关系。该矩阵通过大脑功能对齐模块进行优化,采用多层次对齐损失实现软性跨个体映射。
- 实验表明,MindAligner在视觉解码任务中,只有6%的模型参数被学习时,便超越了现有的最先进方法。
- 我们进行了跨个体的大脑功能可视化研究,发现早期视觉皮层在不同个体间活动相似,而与记忆和空间导航相关的高级视觉皮层则表现出显著的个体间差异。

[arXiv26]SAGE: A Service Agent Graph-guided Evaluation Benchmark [Github]
Ling Shi*, Yuqin Dai*, Ziyin Wang, Ning Gao, Wei Zhang, Chaozheng Wang, Xinwei Wu, Yujie Wang, Wei He, Jinpeng Wang, Linlong Xu, Deiyi Xiong
- 提出SAGE基准,将非结构化SOP形式化为动态对话图,实现逻辑合规与路径覆盖验证。
- 引入对抗意图分类与扩展机制,支持低成本跨域部署及自动对话数据合成。
- 发现模型存在”执行鸿沟”与”共情韧性”:能识别意图但执行错误,对抗下仍礼貌。

[arXiv][DAGENT: Optimizing Multi-Hop RAG as Executable Reasoning Workflows]
Jingyu He*, Yuqin Dai*, Kaiwen Zhang, Hang Zhang, Shangke Lyu, Yuchen Yan, Haiwen Hong, Hong Zhao, Yao Fu, Weiming Lu, Yiquan Wu, Yongliang Shen
- 提出 DAGENT 框架,将多跳 RAG 过程建模为可执行推理工作流,实现结构化的检索-推理路径规划。
- 通过工作流优化策略,显著提升多跳问答场景下的检索精度与推理质量。
- 在多个多跳问答基准上取得优于现有 RAG 方法的性能。

[arXiv][Have LLMs Truly Learned to Search? Rehearsal-Guided Execution for Robust Agentic RAG]
Jinyan Chen*, Yuqin Dai*, Yijun Li, Yuchen Yan, Zhipiao Liu, Hongwei Yang, Yiquan Wu, Wenqi Zhang, Weiming Lu, Yongliang Shen
- 提出 Rehearsal-RL 框架,通过”排练-执行”两阶段范式增强 LLM 的搜索规划能力与鲁棒性。
- 引入排练引导机制,让模型在正式执行检索前先进行轻量预演,减少无效搜索与推理偏差。
- 在多个 RAG 基准上验证了方法的有效性,显著提升 Agentic RAG 在复杂查询场景下的表现。

[CVPR26 Findings]GreenPlanner: Practical Floorplan Layout Generation via an Energy-Aware and Function-Feasible Generative Framework
Pengyu Zeng*, Yuqin Dai*, Jun Yin*, Jing Zhong, Ziyang Han, Chaoyang Shi, ZhanXiang Jin, Maowei Jiang, Yuxing Han, Shuai Lu†
- 提出了 GreenPlanner 框架:将“设计评估”与“生成”统一起来的节能住宅设计框架。它解决了现有生成方法缺乏自动评估机制、容易产生不符合现实约束(如能耗过高或空间功能缺陷)的布局的问题,实现了兼顾可持续性和空间功能合理性的自动化设计。
- 构建了两个关键数据集:DesignFD(设计可行性数据集):包含带有专家验证的能耗和空间功能标签,用于学习设计约束的先验知识。GreenPD(绿色平面图数据集):基于 DesignFD 并通过评估器筛选和修正得到的,它将用户需求与符合法规的布局配对,消除了无效样本(从 60% 降至 0%),为训练提供了高质量数据。
- 开发了核心模型 PDE 与 GreenFlow:PDE(实用设计评估器):能够快速预测能耗表现和空间功能有效性,准确率超过 99%。GreenFlow 生成器:一种基于流(flow-based)的生成模型,利用 PDE 的反馈进行训练,实现了在现实约束下的可控布局生成,相比专业建筑师的设计效率提升了 87%。

[AAAI27 Under Review][Empowering a Self-Evolving LLM for Urban Land-Use Planning without Expert Supervision]
Chaoyang Shi*, Yuqin Dai*, Pengyu Zeng, Jun Yin, Ziyang Han, Yuchen Zhou, Shuai Lu, Yuxing Han
- 将可执行城市规划定义为紧凑型 LLM 可从空间反馈中学习、无需专家标签的任务,并指出朴素自进化会受“直接生成城市级任务”和“直接求解全图”两类失败模式阻碍。
- 构建 UrbanBench:基于 OSM 的可执行基准,覆盖 53 个真实城市窗口和 8,834 个规划单元,通过 5 类可程序验证的空间目标实现标准化比较。
- 提出 UrbanZero 空间自进化框架:单一模型同时担任任务提出者与求解者,生成语义规划简报,编译为地块级任务并以 patch-wise planning 求解,再用程序验证器的结果反馈调节后续任务。
- 实验表明 UrbanZero 将规划能力内化到紧凑本地模型中,使基础规划器提升 25.9%,原始总分超过最强 API 参考模型,并验证 patch-wise solving 与 outcome-conditioned feedback 对城市级 LLM 规划有效。

[AAAI27 Under Review][PlanCraft: Sketch, Refine, and Furnish for Architect-Inspired Progressive 3D Residential Scene Generation]
Pengyu Zeng*, Yuqin Dai*, Jun Yin*, Ziyang Han, Ng Cheuk Hei, Jing Zhong, Chaoyang Shi, ZhanXiang Jin, Maowei Jiang, Yuxing Han, Shuai Lu†
- 识别“设计是渐进式过程”和“平面图是空间先验”两点被忽视的结构性洞察,并提出 PlanCraft:首个将不完整设计草图连接到完整带家具 3D 住宅场景的统一系统。
- 构建 SketchPlan 自动化数据流水线,通过回放建筑师绘图过程生成不同完成度的局部草图训练对;提出 PlanCraft-Diff 统一图像域扩散模型,结合两阶段粗到细训练与连通性候选过滤,使 FID 相比 2D 基线降低 2.6–11 倍。
- 设计 PlanCraft-Agent:一个扎根于 3D 场景的装配阶段,将语言模型约束生成、规则扩展与碰撞感知摆放求解器结合,并以验证过的房间边界为锚点;专家评估显示其在合理性、实用性和个性化上超过此前语言模型式 3D 系统。

[AAAI27 Under Review]RenoCAD: Residential Floorplan Renovation via Constraint-Preserving Editable Vector Generation
Pengyu Zeng*, Jun Yin*, Yuqin Dai*, Peilin Li, Ng Cheuk Hei, Han Zheng, Haoyuan Sun, Ziyang Han, Jing Zhong, Tiancheng Zeng, ZhanXiang Jin, Chaoyang Shi, Shuai Lu
- 将住宅改造建模为选择性向量生成,提出区别于完整户型合成的“保留、编辑、验证”三难问题,并构建包含 10,451 个案例的 RenoCAD-DS。
- 提出 RenoCAD-IR,显式区分固定建筑基元与可编辑布局对象;进一步开发泄漏受控的自回归流水线,包含结构化解析、确定性固定元素合并和向量级验证。
- 实验揭示语法有效性与几何正确性之间存在明显差距。RenoCAD 在房间与门恢复方面显著优于直接提示的 LLM/VLM,并持续提升 CV-Bench 与 BLINK 上的平面空间推理能力。
[ICASSP24 Oral]Text2Avatar: Text to 3D Human Avatar Generation with Codebook-Driven Body Controllable Attribute
Chaoqun Gong*, Yuqin Dai*, Ronghui Li, Achun Bao, Jun Li, Jian Yang, Yachao Zhang, Xiu L.
- Text2Avatar 是第一个基于复杂耦合的输入文本提示生成逼真风格的 3D Avatar 的模型,实现了多属性可控和逼真的 3D 人头像生成。
- Text2Avatar 模型基于 3D-Aware GAN(NeRF-Based), 使用 GAN-Inversion based 的方式实现文本对齐, 巧妙化解了当前文本标注的写实风格三维 Avatar 数据集缺失的问题.
- 提出 Multi-Modal Encoder, 能够作为插件服务于其他模型, 具有很强的可扩展性.

[ICASSP24]EXPLORING MULTI-MODAL CONTROL IN MUSIC-DRIVEN DANCE GENERATION
Ronghui Li*, Yuqin Dai*, Yachao Zhang, Jun Li, Jian Yang, Jie Guo, Xiu Li.
- 提出了第一个统一的框架,能够生成高质量的舞蹈动作,并支持多模态控制,包括同时进行流派控制、语义控制和空间控制。
- 模型能够进行音乐跨模态舞蹈生成(Music2Dance), 基于 VQ-GPT 架构, 能够一次生成长达 16s 的舞蹈动作, 并能通过自回归的方式对生成内容进行拓展.
参与工作(10篇)

[arXiv26]Reinforcing Real-world Service Agents: Balancing Utility and Cost in Task-oriented Dialogue
Ning Gao, Wei Zhang, Yuqin Dai, Ling Shi, Ziyin Wang, Yujie Wang, Wei He, Jinpeng Wang, Chaozheng Wang
- 将框架重构为任务导向对话重构为多粒度强化学习过程。
- 建立以用户为中心的高保真环境,支持动态策略探索。
- 引入CMPO算法,有效平衡用户奖励与全局成本约束。

Zhang, Yulong; Wang, Li; Du, Wei; Li, Peilin; Yuqin Dai; Zhao, Zhiyuan; Fang, Lingyong; Liu, Ziniu; Zhang, Ru; Zhu, Huijia; Liu, Gongshen
- 提出了一种名为 NCV 的免训练框架,通过将复杂的思维链推理重构为结构化的节点级二元一致性检查,解决了长链推理中错误定位不准和注意力分散的难题。
- 通过将验证任务分解为轻量级的节点检查,该方法实现了精确的错误定位,并避免了昂贵的长文本生成与多重采样,显著增强了系统的可解释性与计算效率。
- 实验结果显示该方法在多个公共数据集上的 F1 分数相比基线提升了 10% 至 25%,同时 Token 消耗量比传统方法减少了 6 到 58 倍。

[WWW26 Workshop]RAMA: Retrieval-Augmented Multi-Agent Framework for Misinformation Detection in Multimodal Fact-Checking
Shuo Yang, Zijian Yu, Zhenzhe Ying, Yuqin Dai, Guoqing Wang, Jun Lan, Jinfeng Xu, Jinze Li, Edith C.H. Ngai
- 提出了一个多模态融合框架,将视觉特征与语言模型有效结合,实现跨模态推理与生成能力的显著提升。
- 引入动态注意力机制,根据上下文自适应地调整视觉与文本信息的权重,从而提升了模型在多模态任务中的鲁棒性与泛化性。
- 在多项多模态基准测试(如图文匹配、视觉问答等)中,该方法均取得了优于现有方法的性能表现,验证了其有效性与先进性。

[AAAI26]Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models
Yuchen Zhou, Jiayu Tang, Shuo Yang, Xiaoyan Xiao, Yuqin Dai, Wenhao Yang, Chao Gou, Xiaobo Xia, Tat-Seng Chua
- 提出 LogicBench 基准:构建了一个涵盖 9 类逻辑关系、4 种应用场景和 2 种评测任务的综合基准,包含超过 5 万对逻辑视觉-语言样本,用于系统性评估多模态大模型的逻辑理解能力。
- 开展系统性诊断评测:首次系统性分析多模态大模型在逻辑推理方面的表现,揭示了其在理解复杂逻辑结构时存在的显著“逻辑盲点”和固有限制。
- 提出 LogicCLIP 框架:设计了一种新型训练方法,有效增强模型的逻辑敏感性。实验表明,LogicCLIP 在多个领域显著提升逻辑理解能力的同时,还保持甚至超越了在标准视觉-语言基准上的表现。

[EMNLP25]Card: Cross-modal agent framework for generative and editable residential design
Pengyu Zeng, Jun Yin, Miao Zhang, Yuqin Dai, Jizhizi Li, ZhanXiang Jin, Shuai Lu
- 提出 CARD 跨模态住宅设计框架,可从自然语言生成并编辑住宅布局。
- 设计 CMI-P 跨模态空间表示与 Text2FloorEdit 生成模型,实现标准化与可迭代设计。
- 构建包含规范审查、需求验证与 3D 可视化的多代理系统,支持普通用户无专业背景进行住宅设计。

[ACM MM25]MRED-14: A Benchmark for Low-Energy Residential Floor Plan Generation with 14 Flexible Inputs
Pengyu Zeng, Jun Yin, Haoyuan Sun, Yuqin Dai, Maowei Jiang, Miao Zhang, Shuai Lu
- 构建首个包含14种输入类型的多模态住宅能耗数据集 MRED-14。
- 提出可灵活适配多输入的低能耗户型生成模型 LER-net。
- 实验验证模型能降低户型能耗并优于现有方法,具有实际设计可行性。

[ACMMM25 Datasets]RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
Shuo Yang, Yuqin Dai, Guoqing Wang, Xinran Zheng, Jinfeng Xu, Jinze Li, Zhenzhe Ying, Weiqiang Wang, Edith CH Ngai.
- 我们提出 RealFactBench 基准测试集:构建了一个涵盖知识验证、谣言检测和事件核查等多种真实世界任务的综合性基准,用于评估大语言模型(LLMs)和多模态大模型(MLLMs)的事实核查能力。
- 引入新的评估指标 Unknown Rate (UnR):该指标用于更细致地衡量模型在不确定性处理方面的表现,帮助评估模型在保守性与自信程度之间的平衡。
- 开展大规模实证研究:在7个典型LLMs和4个MLLMs上进行了系统评估,揭示了当前模型在事实核查任务中的局限性,并为后续研究提供了有价值的洞察。

[TPAMI25]Human Motion Video Generation: A Survey
Haiwei Xue,Xiangyang Luo,Zhanghao Hu,Xin Zhang,Xunzhi Xiang,Yuqin Dai,Jianzhuang Liu,Zhensong Zhang,Minglei Li,Jian Yang,Fei Ma,Zhiyong Wu,Changpeng Yang,Zonghong Dai,Fei Richard Yu.
- 数字人视频生成领域综述.
- 总结了超过300篇最新数字人视频生成了领域相关文献的内容.
- 总结了现有数字人视频生成领域范式.

[ACL25 Oral]FloorPlan-LLaMa: Aligning Architects’ Feedback and Domain Knowledge in Architectural Floor Plan Generation
Jun Yin, Pengyu Zeng, Haoyuan Sun, Yuqin Dai, Han Zheng, Miao Zhang, Yachao Zhang, Shuai Lu
- 提出了ArchiMetricsNet数据集与FloorPlan-MPS评价模型:首次构建了一个包含功能性、流线性和整体性评估得分的楼面图数据集,并配有详细的文本分析,用以更贴近建筑专业知识地评估生成结果。
- 开发了FloorPlan-LLaMa生成模型并引入RLHF机制:设计了基于自回归框架的楼面图生成模型FloorPlan-LLaMa,并通过引入FloorPlan-MPS作为奖励模型,借助人类反馈强化学习(RLHF)机制使模型更符合建筑师的专业偏好。
- 实验证明方法优于现有基线并获专业认可:在文本条件和类别条件的生成任务中均优于现有基线模型,且经专业建筑师验证,其生成结果更为合理,契合人类设计偏好。
🏛️ Professional Services
Student Reviewer:
- AAAI 2026, AAAI 2027
- ICLR 2026
- NeurIPS 2027
- Pattern Recognition (PR)
- NeuroComputing
🏋️ Skills
英语能力
-
IELTS 7.0
in 2019, 2020.
-
CET6 575
in 2020.
-
CET4 623
in 2019.
社交技能
🏓一点业余乒乓球>🎤卡拉永远ok>👥TRPG»🏸喜欢(站桩输出的)双打羽毛球