arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-08-31 至 2026-08-31 共收录 21
2608.28478 2026-08-31 cs.CL 新提交

Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge

盲人摸象:探究长尾分歧知识下大语言模型(LLM)的认知近视问题

Zhuoshi Pan, Junru Lu, Yan Qian, H. Vicky Zhao, Di Yin, Xing Sun

机构 * Tsinghua University(清华大学) Tencent(腾讯) University of Warwick(华威大学)

AI总结 本研究推出ElephantBench探针,发现LLM在长尾分歧知识问答中仅52.4%的问题能同时回忆两种解释,模型规模扩大等方法无法消除认知不完整性,为评估LLM认知严谨性提供了工具。

Comments 10 pages, 10 figurs, 1 table, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28476 2026-08-31 cs.CL 新提交

ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL

ContextPilot:通过细粒度强化学习为智能体教授主动上下文管理

Zhuoshi Pan, Qizhi Pei, Junru Lu, Honglin Lin, H. Vicky Zhao, Di Yin, Xing Sun

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shanghai AI Lab(上海人工智能实验室)

AI总结 本研究针对现有主动上下文管理方法的局限,提出ContextPilot框架,通过扩充工具集并设计细粒度RL方法,在长程智能体任务中实现更紧凑上下文下的更优性能,优于现有基线。

Comments 10 pages, 6 figures, 5 tables, accepted to EMNLP 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28266 2026-08-31 cs.RO 新提交

CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning

CoCoBench:用于具身多智能体任务规划的协作协调基准

Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang, Peiwen Lin, Xu Cao, Chuang Wang, Lei Yuan, Jian Su, Lan-Zhe Guo

机构 * Nanjing University(南京大学) AgiBot Tsinghua University(清华大学)

AI总结 研究人员提出CoCoBench这一家庭任务多智能体具身协调基准,评估11种MLLM后发现协调能力具构造特异性,为相关模型设计提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28188 2026-08-31 cs.LG cs.AI cs.AR 新提交

Beyond Flat Netlist: Hierarchical Graph Representation Learning for Scalable Analysis of Sequential Circuits

超越平面网表:用于时序电路可扩展分析的分层图表示学习

Jingyi Zhou, Zhengyuan Shi, Jiaying Zhu, Ziyang Zheng, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 针对电路表示学习受工业网表规模与时序动态建模缺陷制约的问题,提出DeepSeq3分层框架,结合双GNN架构与状态中心预训练,在大规模基准上实现BMC求解时间降18%且保证正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28128 2026-08-31 cs.LG cs.AI 新提交

VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning

VICT:用于长 horizon LLM 智能体强化学习的验证器插装式信用追踪

Pengcheng Li, Zhengyang Zhang, Dongxu Zhang, Sui Huang, Shaohua Ma

机构 * Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Jiaxing Nanhu University(嘉兴南湖学院)

AI总结 针对长 horizon LLM 智能体强化学习的细粒度信用分配挑战,提出 VICT 方法,通过验证器侧的证明边追踪分配信用,在 ALFWorld 和 WebShop 上性能显著优于仅结果训练。

Comments accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28078 2026-08-31 cs.CV 新提交

Task-State Adaptation with Prototype Memory for Multi-Task Dense Prediction

面向多任务密集预测的原型记忆任务-状态自适应

Yangyang Xu, Haobo Yuan, Yuzhu Wang, Duo Su, Xi Ye, Yibo Yang, Jun Zhu

机构 * Tsinghua University(清华大学) University of California, Merced(加州大学默塞德分校) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出MemMTL多任务密集预测框架,结合原型记忆与稀疏路由,在NYUD-v2等数据集上评估其预测质量、计算成本及各模块贡献。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28053 2026-08-31 cs.CL 新提交

CNeo-Bench: Diagnosing Large Language Models on Chinese Neologisms

CNeo-Bench:针对中文新词汇的大语言模型诊断基准

Kaiyan Zhao, Zhongtao Miao, Zheyong Xie, Shaosheng Cao, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学) Xiaohongshu Inc.(小红书公司) Tsinghua University(清华大学)

AI总结 本研究构建了含4759个中文新词汇的基准CNeo-Bench,搭配两层评估框架评估18个大语言模型,发现模型在定义生成上表现差,存在识别-操作差距,少样本提示仍无法解决部分难题。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27998 2026-08-31 cs.AI 新提交

Automated Analysis Framework for Multilingual Climate-Health Literature Based on Multi-Agent Large Language Model

基于多智能体大语言模型的多语言气候-健康文献自动分析框架

Yuze Sun, Shihui Zhang, Jiancheng Pan, Yunjia Ye, Wentao Luo, Jiahao Li, Quan Zhang, Wenjia Cai, Xiaomeng Huang

机构 * Tsinghua University(清华大学) Huawei Technologies Co., Ltd(华为技术有限公司) Renmin University of China(中国人民大学) Beijing Forestry University(北京林业大学) National Institute of Natural Hazards, Ministry of Emergency Management of China(中国应急管理部国家自然灾害防治研究院)

AI总结 针对多语言气候-健康文献分析痛点,提出多智能体大语言模型自动分析框架,经双语语料验证核心信息提取F1值达0.92,可支撑该领域大规模证据挖掘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27925 2026-08-31 cs.CL 新提交

Entity-Memory Graph Retrieval Improves Evidence Coverage in Long-Conversation Question Answering

实体记忆图检索提升长对话问答中的证据覆盖率

Shumao Sun

机构 * Tsinghua University(清华大学)

AI总结 该研究提出实体记忆图检索方法,在10个LoCoMo对话的1986个问题上,使top-k=25的证据召回率提升约4.74个百分点,实现检索覆盖增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27922 2026-08-31 cs.CV 新提交

DensityKV: Density-Guided KV Cache Compression for Long Video Generation

DensityKV:面向长视频生成的密度引导式KV缓存压缩

Wenqu Zhao, Xuemin Chi, Xin Zhang, Guoqing Ma, Baorun Li, Jianjie Fang, Peizhi Tang, Chen Gao, Wei Wu

机构 * Manifold AI(流形人工智能) Tsinghua University(清华大学)

AI总结 DensityKV是一种无需训练的历史KV库管理策略,通过密度引导压缩KV缓存,提升长视频生成的时序一致性与稳定性,且存储不随推演长度增长。

Comments 17 pages, 9 figures, 2 tables. Code: this https URL (https://github.com/ZhaoWQQ/DensityKV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27501 2026-08-31 cs.CL 新提交

INSPIRE: An Internalize-Then-Improve Approach for Example-Driven Mathematical Reasoning

INSPIRE:一种用于示例驱动数学推理的“先内化再改进”方法

Shuai Wang, Jiayi Kuang, Yinghui Li, Haojing Huang, Xinnian Liang, Ying Shen, Liang Lin

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) ByteDance Inc.(字节跳动公司) Peng Cheng Laboratory(鹏城实验室)

AI总结 该研究针对LLMs数学推理中内化不足的问题,提出INSPIRE方法,结合RGSI与分阶段规则偏好训练,提升了示例驱动数学推理能力且未降低通用推理水平。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27477 2026-08-31 cs.AI cs.CV 新提交

Benchmarking General Mobile Assistants in Challenging Real-World Scenarios

在具有挑战性的真实场景中对通用移动助手进行基准测试

Yiqi Zhu, Feiyu Gao, Jiaxing Fan, Jiahui Zeng, Minggang Wu, Chenliang Li, Haiyang Xu, Peng Li, Ming Yan, Yang Liu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

AI总结 该研究提出名为GMA的移动助手基准,涵盖七个应用与300个不同难度任务,评估八个前沿模型发现其性能随任务复杂度提升而下降,还证实合适的智能体控制设计可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26714 2026-08-31 cs.CV cs.AI 版本更新

LiveVVT: High-Fidelity Video Virtual Try-On in Real Time

LiveVVT:高保真实时视频虚拟试穿

Yushe Cao, Shikun Feng, Ruxiang Duan, Liyong Wang, Dianxi Shi, Chun Yu, Junliang Xing

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) South China University of Technology(华南理工大学) Beijing Jiaotong University(北京交通大学)

AI总结 LiveVVT是一种滚动式流式扩散框架,通过保留双向建模与互补内存维持一致性,结合渐进式蒸馏优化,实现了比同等规模模型延迟降26倍、吞吐量提11倍的高保真实时视频虚拟试穿。

Comments 16 pages, 13 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24696 2026-08-31 cs.LG cs.AI 版本更新

On-policy Distillation with Verifiable Reward

结合可验证奖励的在线蒸馏

Wenze Lin, Jiale Zhao, Xitai Jiang, Songde Rao, Yining Li, Shenzhi Wang, Bingxiang He, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学LeapLab) Beihang University(北京航空航天大学) SMS, Peking University(北京大学SMS) NLPLab, Tsinghua University(清华大学NLPLab)

AI总结 本研究提出OPDVR方法,无缝结合OPD与RLVR且不增加超参数,经六个推理基准实验验证其性能优于标准OPD。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24024 2026-08-31 cs.AI 版本更新

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放

Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

机构 * University of Southern California(南加州大学) Pohang University of Science and Technology (POSTECH)(浦项科技大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对多轮搜索智能体中基于置信度投票因复制膨胀失效的问题,提出检索接地投票(RGV)方法,在四个基准和五个 LLM 上性能优于基线,准确率最高提升 5.4%

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18025 2026-08-31 cs.LG cs.AI cs.SD 版本更新

How Far Should Tokenization Go? Predictive Effectiveness and Relational Losslessness

为何GPT风格模型无法直接迁移到符号音乐:错误坐标系中的压缩

Yi Wang

机构 * Tsinghua University(清华大学)

AI总结 该研究针对GPT风格模型无法直接迁移到符号音乐的问题,提出有效性-无损性框架,通过构建预测有效且关系无损的坐标系优化标记化,实验验证了相关边界,揭示了跨模态迁移的关键在于标记化接口而非架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25270 2026-08-31 cs.CL cs.AI cs.LG 版本更新

Where Steering Signals Come From: Activation Source Selection in Activation Steering

转向信号来自何处:激活转向中的激活源选择

Jiaran Ye, Lingxu Ran, Zijun Yao, Chenpeng Wang, Yong Jiang, Lei Hou, Juanzi Li, Liangming Pan

机构 * Peking University(北京大学) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) YiXin-AILab(易信人工智能实验室)

AI总结 研究激活转向中转向信号的来源选择,通过实验表明改变源激活会影响转向成功率,有效转向信号来自执行边界状态,基于此提出尾部减法,揭示转向取决于模型即将做的事而非已出现的内容。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05917 2026-08-31 cs.CV cs.CL 版本更新

MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering

MemoryCard: 面向长视频问答的主题感知多模态线索压缩

Qing Yang, Pengcheng Huang, Xinze Li, Zhenghao Liu, Yukun Yan, Yu Gu, Ge Yu, Gang Li, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Digital China Group(数字中国集团)

AI总结 提出MemoryCard框架,通过将长视频分割为主题事件单元并生成事件级摘要和代表性视觉时刻,以记忆卡形式增强VLMs的长视频问答能力,在相同视觉令牌预算下准确率提升高达21.8%。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01629 2026-08-31 cs.CL 版本更新

Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation

基准测试LLM作为裁判在长文本输出评估中的应用

Junjie Chen, Yuxi Dong, Haitao Li, Weihang Su, Yujia Zhou, Min Zhang, Yiqun Liu, Qingyao Ai

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) University of Science and Technology Beijing(北京科技大学)

AI总结 提出LongJudgeBench基准,系统评估LLM裁判在长文本输出评估中的可靠性,发现当前模型存在显著可靠性差距。

Comments EMNLP 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08577 2026-08-31 cs.CL cs.AI cs.LG cs.PF 版本更新

Think-at-Hard: Dynamic Looped Transformers for Improved Reasoning

Think-at-Hard: 选择性潜在迭代以改进推理语言模型

Tianyu Fu, Yichen You, Zekai Chen, Guohao Dai, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对循环变压器中潜在过思考问题,提出Think-at-Hard方法,通过轻量级决策器选择性地在困难令牌上触发潜在迭代,并采用深度感知LoRA和双因果注意力机制,在数学、问答和编码任务上一致提升性能。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07188 2026-08-31 cs.CV 版本更新

Hierarchical Feature-level Reverse Propagation for Post-Training Neural Networks

用于训练后神经网络的分层特征级反向传播

Ni Ding, Shuchang Wang, Lei He, Shengbo Eben Li, Keqiang Li

机构 * School of Vehicle and Mobility, Tsinghua University, Beijing 100084, China(清华大学车辆与移动系统学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University, Beijing 100084, China(清华大学智能绿色车辆与移动系统国家重点实验室) School of Mathematics and Statistics, Beijing Institute of Technology, Beijing 100081, China(北京理工大学数学与统计学院)

AI总结 提出FR-PT分层框架,基于CCP和MDP及相关算法处理逆问题,在85种训练后设置中63项优于基准,实现神经网络训练后可控适应与透明度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏