arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-31 至 2026-08-31 共收录 69 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2608.28447 2026-08-31 cs.AI 新提交 79%

Learning to Use Tools: Reinforcement Learning for Tool-Integrated Mathematical Reasoning

学习使用工具:用于工具集成数学推理的强化学习

Minghui Xu, Zi Wang

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对Countdown任务,构建工具使用的SFT数据集并采用多种强化学习方法,结合计算器工具集成提升LLM数学推理,使pass@1达66.0%,显著降低计算与验证错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27501 2026-08-31 cs.CL 新提交 79%

INSPIRE: An Internalize-Then-Improve Approach for Example-Driven Mathematical Reasoning

INSPIRE:一种用于示例驱动数学推理的“先内化再改进”方法

Shuai Wang, Jiayi Kuang, Yinghui Li, Haojing Huang, Xinnian Liang, Ying Shen, Liang Lin

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) ByteDance Inc.(字节跳动公司) Peng Cheng Laboratory(鹏城实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对LLMs数学推理中内化不足的问题,提出INSPIRE方法,结合RGSI与分阶段规则偏好训练,提升了示例驱动数学推理能力且未降低通用推理水平。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28481 2026-08-31 cs.CL cs.AI 新提交 62%

NL2AGBench: Benchmarking LLM Auto-Formalization for AlphaGeometry

NL2AGBench:面向AlphaGeometry的大语言模型自动形式化基准测试

Samuel Xiao, Judy Song, Rory Hu, Ziliang Zong

机构 * Valley Christian High School(谷基督高中) Vandegrift High School(范德格里夫特高中) Groton School(格罗顿学校) Texas State University(德克萨斯州立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出NL2AGBench基准,评估LLMs将英文几何问题转换为AlphaGeometry兼容形式化表示的能力,发现闭源模型可实现80%以上可执行翻译率,开源模型表现欠佳,还提出错误分类法并验证了多种缓解策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27513 2026-08-31 cs.LG cs.AI 新提交 62%

DAMP: Decay-Aware Mixed-Precision Recurrent-State Quantization

DAMP:感知衰减的混合精度循环状态量化

Tao Zhang, Jianchao Tan, Pingwei Sun, Yanqi Yu, Zixu Jiang, Yuchen Xie, Xunliang Cai, Ziqian Zeng

机构 * South China University of Technology(华南理工大学) Meituan(美团) East China Normal University(华东师范大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DAMP是针对GDN、KDA类语言模型循环状态的混合精度量化方法,通过识别高风险通道差异化精度存储,在接近FP32基线精度的同时大幅降低存储、加速更新并减少推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 3 篇

2608.28435 2026-08-31 cs.RO 新提交 82%

Linear Temporal Logic Translation via Human-Inspired Self-Constrained Reasoning for Robot Task Specification

面向机器人任务规范的、基于类人自约束推理的线性时态逻辑翻译

Haofei Hou, Fanxu Meng, Shunyi Zhao, Kairui Yang, Mengchen Cai, Lecheng Ruan, Qining Wang

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) School of Integrated Circuits, Peking University(北京大学集成电路学院)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 该研究提出自约束推理(SCR)框架,将结构知识内化到模型决策中,以在不破坏推理的前提下,提升将人类指令翻译为线性时态逻辑(LTL)时的领域约束满足度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28421 2026-08-31 cs.AI 新提交 57%

Program Learning with Verifiable Rewards: Symbolic Backpropagation for Post-Training LLMs

可验证奖励的程序学习:针对后训练大语言模型的符号反向传播

Vishvesh Bhat

机构 * CoreThink AI

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PLVR方法,通过符号反向传播从输入输出示例学习显式程序,在代码基准上提升大语言模型推理能力,边际成本低且效果优于RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27869 2026-08-31 cs.AI 新提交 57%

See, Hypothesize, Validate: Multimodal Agentic Framework for Discovering Governing PDEs

观测、假设、验证:用于发现控制偏微分方程的多模态智能体框架

Sarang Manoj Pekhale, Amartya Roy, Rajat Sarkar, Souvik Chakraborty

机构 * Indian Institute of Technology Delhi(印度德里理工学院) Robert Bosch GmbH(罗伯特·博世有限公司) TCS Research(塔塔咨询服务公司研究院) Yardi School of Artificial Intelligence (ScAI)(亚迪人工智能学院) Department of Applied Mechanics(应用力学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出多模态智能体框架MAGE,通过四个专业化智能体协作迭代发现控制PDE,在经典PDE套件等测试中实现优异恢复与误差表现,支持无库控制定律发现的结构化智能体推理研究。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 19 篇

2608.28270 2026-08-31 cs.RO cs.AI 新提交 83%

Spatial-Semantic Reasoning using Large Language Models for Efficient UAV Search Operations

基于大语言模型的空间语义推理用于高效无人机搜索任务

Marin Maletic, Marijana Peti, Tamara Petrovic, Stjepan Bogdan

机构 * University of Zagreb(萨格勒布大学) Faculty of Electrical Engineering and Computing(电气工程与计算机学院) LARICS (Laboratory for Robotics and Intelligent Control Systems)(拉里克机器人与智能控制系统实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 该研究提出基于大语言模型的无人机实时语义导航框架,结合多技术实现高效目标导航,经仿真与真实实验验证可缩短任务时长且保持高搜索准确率。

Comments 8 pages, preprint, Published in: 2025 European Conference on Mobile Robots (ECMR), DOI: https://doi.org/10.1109/ECMR65884.2025.11163229

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27847 2026-08-31 cs.AI 新提交 83%

From Uncertainty to Clinical Risk: Severity-Aware Conformal Planning for Interactive Medical Diagnosis

从不确定性到临床风险:面向交互式医疗诊断的严重程度感知共形规划

Yue Zhou, Haiyang Zhou, Jin Zhang, Kong Wang, Yongxin Ni, Youhua Li, Hanwen Du

机构 * Lanzhou University(兰州大学) Hunan University(湖南大学) National University of Singapore(新加坡国立大学) City University of Hong Kong(香港城市大学) The Ohio State University(俄亥俄州立大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对交互式医疗诊断漏诊重症的风险与长程规划缺失问题,提出严重程度感知共形临床规划框架,在DDXPlus和MediQ上提升了诊断准确性、鉴别质量并降低了高风险错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28300 2026-08-31 cs.RO cs.AI 新提交 79%

MaCoPlanner: LLM-Assisted Manual-Compiled Task Planning with Proactive Safety Verification for Robotic Industrial Panel Operation

MaCoPlanner:面向机器人工业面板操作的、结合主动安全验证的大语言模型辅助人工编译任务规划

Guipeng Xin, Jiahe Xua, Mohammad Deghat, Chenhui Wan, Jie Liu, Youmin Hu, Zhongxu Hu

机构 * Huazhong University of Science and Technology(华中科技大学) University of New South Wales(新南威尔士大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 MaCoPlanner是面向机器人工业面板操作的规划框架,通过编译设备手册知识生成规划,经主动安全验证后执行,大幅提升了任务成功率,在Level-2、Level-3任务上分别提升了21.6、17.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28075 2026-08-31 cs.RO 新提交 78%

Plan Along the Way: Event-Triggered Foundation-Model Planning for TAMP Execution in Partially Observable Manipulation

动态规划:部分可观测操纵任务中用于TAMP执行的事件触发式基础模型规划

Puru Ojha, Narendhiran Vijayakumar, Nav Singhal, Girish Varma, Antony Thomas

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) Center for Security, Theory and Algorithmic Research, IIIT Hyderabad(IIIT海得拉巴安全、理论与算法研究中心)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出ROBUST TAMP框架,针对部分可观测操纵任务,通过事件触发式重规划机制提升TAMP执行的任务成功率,验证了其在6个RLBench/CoppeliaSim场景中的有效性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27871 2026-08-31 cs.CV 新提交 78%

Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding

时序思维树:面向长视频理解的推理引导型视觉线索搜索

Ziling Huang, Shin'ichi Satoh

专题命中 规划推理 :reasoning(title,abstract)

AI总结 该研究针对MLLMs长视频理解的时序组织缺失问题,提出无训练的T³框架,通过分层时序树与“回答-检索-探索”循环实现粗到细的线索搜索,在三个基准数据集上提升了Qwen2.5-VL-7B的性能。

Comments Accept by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27726 2026-08-31 cs.RO 新提交 78%

Coordinated Motion Planning for Multi-Arm Systems via Iterative LQ Games

基于迭代LQ博弈的多机械臂系统协调运动规划

Junyoung Kim, Hanwen Ren, Lei Zhang, Ahmed H. Qureshi

机构 * Purdue University(普渡大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出迭代LQ博弈框架用于多机械臂协调运动规划,通过可微碰撞惩罚生成安全高效轨迹,性能优于传统方法,凸显微分博弈在多机器人操作中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28266 2026-08-31 cs.RO 新提交 71%

CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning

CoCoBench:用于具身多智能体任务规划的协作协调基准

Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang, Peiwen Lin, Xu Cao, Chuang Wang, Lei Yuan, Jian Su, Lan-Zhe Guo

机构 * Nanjing University(南京大学) AgiBot Tsinghua University(清华大学)

专题命中 规划推理 :planning(title)

AI总结 研究人员提出CoCoBench这一家庭任务多智能体具身协调基准,评估11种MLLM后发现协调能力具构造特异性,为相关模型设计提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28490 2026-08-31 cs.CR cs.AI 新提交 70%

LLM-Based Agents for Software and Systems Security: Approaches, Applications, and Assessment

基于大语言模型(LLM)的软件与系统安全智能体:方法、应用与评估

Jingjing Nie, Jiawei Guo, Krishna Meda, Haipeng Cai

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文通过系统综述2023-2026年的同行评审文献,梳理基于LLM的软件与系统安全智能体的技术方法、应用及评估,指出当前智能体权限未受限、行为不可审计的局限,并展望未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28476 2026-08-31 cs.CL 新提交 70%

ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL

ContextPilot:通过细粒度强化学习为智能体教授主动上下文管理

Zhuoshi Pan, Qizhi Pei, Junru Lu, Honglin Lin, H. Vicky Zhao, Di Yin, Xing Sun

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shanghai AI Lab(上海人工智能实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本研究针对现有主动上下文管理方法的局限,提出ContextPilot框架,通过扩充工具集并设计细粒度RL方法,在长程智能体任务中实现更紧凑上下文下的更优性能,优于现有基线。

Comments 10 pages, 6 figures, 5 tables, accepted to EMNLP 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28062 2026-08-31 cs.AI 新提交 70%

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents

WeAgent-MMSearch:面向多模态搜索智能体的原生文本-视觉交互

Zongkai Liu, Hui Zhang, Liqiang Niu, Zhen Cao, Han Li, Juntao Liu, Wenchao Chen, Chengduo Zhao, Chao Yu, Fandong Meng

机构 * Weixin AI, Tencent(腾讯微信人工智能) Sun Yat-sen University(中山大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对现有多模态搜索智能体忽略图像、长程交互易失败的问题,提出 WeAgent-MMSearch 系统,通过 WeAgent-Harness 实现文本-视觉交互,经 FA-GSPO 后训练后,模型在多模态搜索基准上性能大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27506 2026-08-31 cs.AI 新提交 70%

Thinking Costs Tokens: When More Structure is Worth the Price

思考成本即 token:更多结构何时值得付出代价

Thomas Nolasque, John Grey, Calista Pham, Ankit Vani

机构 * Royal Bank of Canada(加拿大皇家银行)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文研究语言模型推理结构的 token 预算阈值,在 FinQA、TAT-QA 任务上用 GPT-5.4 mini 验证,1500 token 后验证搜索架构性能优于单体模型,交叉点在 1000-1500 token 间。

Comments 8 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28373 2026-08-31 cs.HC cs.AI 新提交 57%

AI as Teammate: Rethinking Task Distribution in Medical Training

AI作为队友:重新思考医学培训中的任务分配

Fendi Tsim, Alina Gutoreva, Anthony Weiss, Nicole Dubosh

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出将医学培训中AI的问题从“误用”重构为“分类错误”,提出以人为中心的SCAN决策框架,为医学教育中AI的应用提供可检验的认知科学实证研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27818 2026-08-31 cs.AI 新提交 57%

AcCoRD: Evaluating User-Agent Collaboration Under Realistic User Preference Dynamics

AcCoRD:评估现实用户偏好动态下的用户-智能体协作

Tejas Srinivasan, Shikib Mehri, Nandita Shankar Naik, Anirban Das, William M. Campbell, Jesse Thomason

机构 * University of Southern California(南加州大学) Contextual AI(Contextual AI公司) Capital One(第一资本金融公司) Georgia Tech University(佐治亚理工大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究针对现有用户-智能体协作基准无法捕捉偏好动态的问题,推出AcCoRD基准,评估前沿LLM处理偏好动态的能力,发现模型难应对交互中出现/演变的偏好,仅提示无法实现所需不确定性识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27580 2026-08-31 cs.AI 新提交 57%

LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails

LongGuard:针对安全护栏长上下文失效的机制分析与无训练缓解方案

Ziyang Chen, Xing Wu, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对LLM安全护栏在长上下文下的失效问题,提出LongGuard框架,经机制分析后开发无训练缓解方案,在多基准测试中实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27476 2026-08-31 cs.AI 新提交 57%

Class-Based Heuristic Selection for Solving the Flying Block Puzzle

求解飞行方块谜题的基于类的启发式选择

Sanyar Ahmadi, Pedram Asadzadeh, Amanj Khorramian

机构 * Faculty of Computer Engineering(计算机工程学院) University of Tehran(德黑兰大学) K. N. Toosi University of Technology(霍加·纳绥尔·丁·图西大学) Department of Electrical and Computer Engineering(电气与计算机工程学院) University of Kurdistan(库尔德斯坦大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 针对启发式搜索在空间规划中的性能问题,提出CBHA*算法,在146个飞行方块谜题基准实例上大幅提升成功率、减少节点扩展,为高效空间规划提供了可推广的自适应启发式机制。

Comments 27 pages, 15 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28409 2026-08-31 cs.RO 新提交 50%

Cooperative Risk-Aware Exploration in Heterogeneous Multi-Robot Systems Using Algorithmic Altruism

基于算法利他主义的异构多机器人系统中的协作风险感知探索

Brooks A. Butler, Jair Certório, João P. Hespanha, Magnus Egerstedt

机构 * School of Electrical and Computer Engineering at Oklahoma State University(俄克拉荷马州立大学电气与计算机工程学院) Instituto Tecnológico de Aeronáutica(航空技术研究所) University of California, Santa Barbara(加州大学圣巴巴拉分校) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 规划推理 :planning(abstract)

AI总结 该研究针对异构多机器人系统,提出基于算法利他主义的博弈论框架,通过社会纳什均衡调整效用实现风险合理分配,减少冗余探索并提升团队性能,经仿真与硬件实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27932 2026-08-31 cs.HC 新提交 50%

Graphionale: How Graph Visualizations of LLM Rationales Affect Human Decision Making

Graphionale:LLM推理依据的图形可视化如何影响人类决策

Xinru Wang, Zhexuan Ma, Ming Yin, Shuai Ma, Thomas W Malone

专题命中 规划推理 :reasoning(abstract)

AI总结 本研究开发了Graphionale作为测试平台,通过204人在线用户研究发现,图形化LLM推理依据对不同任务模态的决策影响不同,匹配推理格式与任务模态是AI解释设计的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27912 2026-08-31 cs.IR 新提交 50%

ITER: Interaction-Aware Retrieval for Agentic Search

ITER:面向智能体搜索的交互感知检索

Haodong Chen, Shuai Wang, Yu Yin, Shengyao Zhuang, Guido Zuccon, Teerapong Leelanupab

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出交互感知稠密检索器ITER,利用智能体轨迹学习信号训练,在六种智能体骨干上优于LRAT,跨智能体鲁棒性强于AgentIR,在两个基准上获显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27631 2026-08-31 cs.IR 新提交 50%

Beyond the Vacuum: Combinatorial Strategy Selection for Competitor-Aware Generative Engine Optimization

超越真空:面向感知竞争对手的生成式引擎优化的组合策略选择

Vaibhav Sourirajan, Yao Zhang, Himanshu Kumar, Sahil Wadhwa, Mann Patel, Amirfarrokh Iranitalab

专题命中 规划推理 :reasoning(abstract)

AI总结 本研究将生成式引擎优化(GEO)形式化为感知竞争对手的策略选择问题,提出两阶段流程,在相关基准及合成数据集上实现最优性能且可跨域迁移。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视觉空间推理 2 篇

2608.27793 2026-08-31 cs.RO 新提交 86%

CAVE-NAV: VLM-Based Autonomous 3D Navigation in Underwater Cave Environments

CAVE-NAV:基于VLM的水下洞穴环境自主三维导航

Zhenqi Wu, Yuanjie Lu, Yisheng Zhang, Miao Yu, Xuesu Xiao, Jaejeong Shin, Xiaomin Lin

机构 * University of South Florida(南佛罗里达大学) George Mason University(乔治梅森大学) University of Maryland(马里兰大学) Seoul National University(首尔大学)

专题命中 视觉空间推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 该研究针对水下洞穴导航的传统方法局限,提出带CoT推理的VLM导航框架,经仿真验证可完成无碰撞的端到端三维洞穴导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28279 2026-08-31 cs.RO 新提交 71%

STEGNav: Spatio-Temporal Event Graph Reasoning for Multimodal Lifelong Object Navigation

STEGNav:面向多模态终身目标导航的时空事件图推理

Yang Chen, Zhenyu Huang, Wenbo Fu, Danyang Peng, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 视觉空间推理 :reasoning(title)

AI总结 针对现有多模态终身导航方法的局限,本文提出无训练框架STEGNav,通过时空事件图的双轴设计优化导航性能,在多个基准数据集上取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 测试时计算 4 篇

2608.28128 2026-08-31 cs.LG cs.AI 新提交 84%

VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning

VICT:用于长 horizon LLM 智能体强化学习的验证器插装式信用追踪

Pengcheng Li, Zhengyang Zhang, Dongxu Zhang, Sui Huang, Shaohua Ma

机构 * Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Jiaxing Nanhu University(嘉兴南湖学院)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 针对长 horizon LLM 智能体强化学习的细粒度信用分配挑战,提出 VICT 方法,通过验证器侧的证明边追踪分配信用,在 ALFWorld 和 WebShop 上性能显著优于仅结果训练。

Comments accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28478 2026-08-31 cs.CL 新提交 57%

Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge

盲人摸象:探究长尾分歧知识下大语言模型(LLM)的认知近视问题

Zhuoshi Pan, Junru Lu, Yan Qian, H. Vicky Zhao, Di Yin, Xing Sun

机构 * Tsinghua University(清华大学) Tencent(腾讯) University of Warwick(华威大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本研究推出ElephantBench探针,发现LLM在长尾分歧知识问答中仅52.4%的问题能同时回忆两种解释,模型规模扩大等方法无法消除认知不完整性,为评估LLM认知严谨性提供了工具。

Comments 10 pages, 10 figurs, 1 table, under review

详情

展开后加载摘要…

URL PDF HTML 收藏