arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-08-31 至 2026-08-31 共收录 12
2608.28478 2026-08-31 cs.CL 新提交

Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge

盲人摸象:探究长尾分歧知识下大语言模型(LLM)的认知近视问题

Zhuoshi Pan, Junru Lu, Yan Qian, H. Vicky Zhao, Di Yin, Xing Sun

机构 * Tsinghua University(清华大学) Tencent(腾讯) University of Warwick(华威大学)

AI总结 本研究推出ElephantBench探针,发现LLM在长尾分歧知识问答中仅52.4%的问题能同时回忆两种解释,模型规模扩大等方法无法消除认知不完整性,为评估LLM认知严谨性提供了工具。

Comments 10 pages, 10 figurs, 1 table, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28476 2026-08-31 cs.CL 新提交

ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL

ContextPilot:通过细粒度强化学习为智能体教授主动上下文管理

Zhuoshi Pan, Qizhi Pei, Junru Lu, Honglin Lin, H. Vicky Zhao, Di Yin, Xing Sun

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shanghai AI Lab(上海人工智能实验室)

AI总结 本研究针对现有主动上下文管理方法的局限,提出ContextPilot框架,通过扩充工具集并设计细粒度RL方法,在长程智能体任务中实现更紧凑上下文下的更优性能,优于现有基线。

Comments 10 pages, 6 figures, 5 tables, accepted to EMNLP 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28266 2026-08-31 cs.RO 新提交

CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning

CoCoBench:用于具身多智能体任务规划的协作协调基准

Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang, Peiwen Lin, Xu Cao, Chuang Wang, Lei Yuan, Jian Su, Lan-Zhe Guo

机构 * Nanjing University(南京大学) AgiBot Tsinghua University(清华大学)

AI总结 研究人员提出CoCoBench这一家庭任务多智能体具身协调基准,评估11种MLLM后发现协调能力具构造特异性,为相关模型设计提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28188 2026-08-31 cs.LG cs.AI cs.AR 新提交

Beyond Flat Netlist: Hierarchical Graph Representation Learning for Scalable Analysis of Sequential Circuits

超越平面网表:用于时序电路可扩展分析的分层图表示学习

Jingyi Zhou, Zhengyuan Shi, Jiaying Zhu, Ziyang Zheng, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 针对电路表示学习受工业网表规模与时序动态建模缺陷制约的问题,提出DeepSeq3分层框架,结合双GNN架构与状态中心预训练,在大规模基准上实现BMC求解时间降18%且保证正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28128 2026-08-31 cs.LG cs.AI 新提交

VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning

VICT:用于长 horizon LLM 智能体强化学习的验证器插装式信用追踪

Pengcheng Li, Zhengyang Zhang, Dongxu Zhang, Sui Huang, Shaohua Ma

机构 * Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Jiaxing Nanhu University(嘉兴南湖学院)

AI总结 针对长 horizon LLM 智能体强化学习的细粒度信用分配挑战,提出 VICT 方法,通过验证器侧的证明边追踪分配信用,在 ALFWorld 和 WebShop 上性能显著优于仅结果训练。

Comments accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28078 2026-08-31 cs.CV 新提交

Task-State Adaptation with Prototype Memory for Multi-Task Dense Prediction

面向多任务密集预测的原型记忆任务-状态自适应

Yangyang Xu, Haobo Yuan, Yuzhu Wang, Duo Su, Xi Ye, Yibo Yang, Jun Zhu

机构 * Tsinghua University(清华大学) University of California, Merced(加州大学默塞德分校) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出MemMTL多任务密集预测框架,结合原型记忆与稀疏路由,在NYUD-v2等数据集上评估其预测质量、计算成本及各模块贡献。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28053 2026-08-31 cs.CL 新提交

CNeo-Bench: Diagnosing Large Language Models on Chinese Neologisms

CNeo-Bench:针对中文新词汇的大语言模型诊断基准

Kaiyan Zhao, Zhongtao Miao, Zheyong Xie, Shaosheng Cao, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学) Xiaohongshu Inc.(小红书公司) Tsinghua University(清华大学)

AI总结 本研究构建了含4759个中文新词汇的基准CNeo-Bench,搭配两层评估框架评估18个大语言模型,发现模型在定义生成上表现差,存在识别-操作差距,少样本提示仍无法解决部分难题。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27998 2026-08-31 cs.AI 新提交

Automated Analysis Framework for Multilingual Climate-Health Literature Based on Multi-Agent Large Language Model

基于多智能体大语言模型的多语言气候-健康文献自动分析框架

Yuze Sun, Shihui Zhang, Jiancheng Pan, Yunjia Ye, Wentao Luo, Jiahao Li, Quan Zhang, Wenjia Cai, Xiaomeng Huang

机构 * Tsinghua University(清华大学) Huawei Technologies Co., Ltd(华为技术有限公司) Renmin University of China(中国人民大学) Beijing Forestry University(北京林业大学) National Institute of Natural Hazards, Ministry of Emergency Management of China(中国应急管理部国家自然灾害防治研究院)

AI总结 针对多语言气候-健康文献分析痛点,提出多智能体大语言模型自动分析框架,经双语语料验证核心信息提取F1值达0.92,可支撑该领域大规模证据挖掘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27925 2026-08-31 cs.CL 新提交

Entity-Memory Graph Retrieval Improves Evidence Coverage in Long-Conversation Question Answering

实体记忆图检索提升长对话问答中的证据覆盖率

Shumao Sun

机构 * Tsinghua University(清华大学)

AI总结 该研究提出实体记忆图检索方法,在10个LoCoMo对话的1986个问题上,使top-k=25的证据召回率提升约4.74个百分点,实现检索覆盖增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27922 2026-08-31 cs.CV 新提交

DensityKV: Density-Guided KV Cache Compression for Long Video Generation

DensityKV:面向长视频生成的密度引导式KV缓存压缩

Wenqu Zhao, Xuemin Chi, Xin Zhang, Guoqing Ma, Baorun Li, Jianjie Fang, Peizhi Tang, Chen Gao, Wei Wu

机构 * Manifold AI(流形人工智能) Tsinghua University(清华大学)

AI总结 DensityKV是一种无需训练的历史KV库管理策略,通过密度引导压缩KV缓存,提升长视频生成的时序一致性与稳定性,且存储不随推演长度增长。

Comments 17 pages, 9 figures, 2 tables. Code: this https URL (https://github.com/ZhaoWQQ/DensityKV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27501 2026-08-31 cs.CL 新提交

INSPIRE: An Internalize-Then-Improve Approach for Example-Driven Mathematical Reasoning

INSPIRE:一种用于示例驱动数学推理的“先内化再改进”方法

Shuai Wang, Jiayi Kuang, Yinghui Li, Haojing Huang, Xinnian Liang, Ying Shen, Liang Lin

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) ByteDance Inc.(字节跳动公司) Peng Cheng Laboratory(鹏城实验室)

AI总结 该研究针对LLMs数学推理中内化不足的问题,提出INSPIRE方法,结合RGSI与分阶段规则偏好训练,提升了示例驱动数学推理能力且未降低通用推理水平。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27477 2026-08-31 cs.AI cs.CV 新提交

Benchmarking General Mobile Assistants in Challenging Real-World Scenarios

在具有挑战性的真实场景中对通用移动助手进行基准测试

Yiqi Zhu, Feiyu Gao, Jiaxing Fan, Jiahui Zeng, Minggang Wu, Chenliang Li, Haiyang Xu, Peng Li, Ming Yan, Yang Liu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

AI总结 该研究提出名为GMA的移动助手基准,涵盖七个应用与300个不同难度任务,评估八个前沿模型发现其性能随任务复杂度提升而下降,还证实合适的智能体控制设计可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏