arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18857 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18857 篇

2603.06638 2026-06-30 cs.LG cs.AI 86%

HEARTS: Benchmarking LLM Reasoning on Health Time Series

HEARTS:基于健康时间序列的LLM推理基准测试

Sirui Li, Shuhan Xiao, Mihir Joshi, Ahmed Metwally, Daniel McDuff, Wei Wang, Yuzhe Yang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HEARTS是一个统一的基准测试,用于评估LLM在一般健康时间序列上的分层推理能力,包含16个真实世界数据集和110个任务,揭示了LLM在多步时间推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20334 2026-06-30 cs.RO cs.AI cs.LG 86%

Demonstration-Free Robotic Control via LLM Agents

无需演示的机器人控制 via LLM 代理

Brian Y. Tsui, Alan Y. Fang, Tiffany J. Hwu

机构 * independent researchers(独立研究人员)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FAEA框架,利用通用大语言模型实现无需演示的机器人操控,通过迭代推理生成操控策略,在多个基准测试中取得高成功率,展示了通用代理在任务规划中的有效性。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15694 2026-06-16 cs.MM cs.AI cs.CV cs.LG 新提交 86%

MAF: Multimodal Adaptive Few-shot Prompting for Sentiment Analysis with MLLMs

MAF: 面向情感分析的多模态自适应少样本提示方法

Hangling Xie

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MAF框架,通过动态检索与查询相关的多模态示例,利用轻量级系数生成网络实时融合多模态相似度,结合多数投票提升MLLM在情感分析中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18419 2026-06-15 cs.LG cs.CL stat.ML 版本更新 86%

Knowing When to Quit: A Principled Framework for Dynamic Abstention in LLM Reasoning

知道何时退出:LLM推理中动态弃权的原则性框架

Hen Davidov, Nachshon Cohen, Oren Kalinsky, Yaron Fairstein, Guy Kushilevitz, Ram Yazdi, Patrick Rebeschini

机构 * Hebrew University of Jerusalem(特拉维夫大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出一个基于正则化强化学习框架的动态弃权原则,通过价值函数与弃权奖励的比较来决定是否提前终止推理,在数学推理和毒性避免任务上优于现有方法。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026. Copyright 2026 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07368 2026-06-15 cs.LG cs.AI 版本更新 86%

Distributional Biases in Post-Training: A Markovian Analysis of Reasoning Trajectories

后训练中的分布偏差:推理轨迹的马尔可夫分析

Dake Bu, Wei Huang, Andi Han, Atsushi Nitanda, Bo Xue, Qingfu Zhang, Hau-San Wong, Taiji Suzuki

机构 * City University of Hong Kong(香港城市大学) Center for Advanced Intelligence Project, RIKEN(RIKEN高级智能研究中心) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR)(A*STAR的CFAR和IHPC) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :post-training(title,abstract);foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 通过马尔可夫链模型分析后训练策略(如RLVR和ORM/PRM)如何强化高概率路径而遗忘稀有但关键的推理步骤,并证明探索策略(如拒绝简单实例和KL正则化)有助于保留稀有CoT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05150 2026-06-15 cs.CL cs.AI 版本更新 86%

Chronological Thinking in Full-Duplex Spoken Dialogue Language Models

全双工口语对话语言模型中的时间顺序思考

Donghang Wu, Haoyang Zhang, Chen Chen, Tianyu Zhang, Fei Tian, Xuerui Yang, Gang Yu, Hexin Liu, Nana Hou, Yuchen Hu, Eng Siong Chng

机构 * Nanyang Technological University(南洋理工大学) StepFun Mila

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Chronological Thinking机制,让全双工对话模型在听用户说话时增量推理,不增加延迟,提升响应质量。

Comments Accepted by SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09157 2026-06-09 cs.CL cs.AI 新提交 86%

SEF-CLGC at SemEval-2026 Task 11: Logical Notation Impact on Language Model Performance

SEF-CLGC在SemEval-2026任务11中的应用:逻辑符号对语言模型性能的影响

Hanna Abi Akl, Fabien Gandon, Catherine Faron, Pierre Monnin

机构 * Université Côte d’Azur, Inria, CNRS, I3S, Sophia Antipolis, France(蔚蓝海岸大学, 法国国家信息与自动化研究所, 法国国家科学研究中心, 信息与系统科学实验室, 索菲亚安蒂波利斯, 法国) Data ScienceTech Institute, Paris, France(数据科学技术学院, 巴黎, 法国)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SEF-CLGC管道,结合形式逻辑符号与小语言模型,在SemEval-2026任务11中评估推理性能,最佳模型在降低内容偏差的同时达到27.80%的内容分数。

Comments Accepted to SemEval-2026 co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09995 2026-06-09 cs.CL cs.AI 版本更新 86%

Context Over Compute Human-in-the-Loop Outperforms Iterative Chain-of-Thought Prompting in Interview Answer Quality

上下文胜过计算 人类在环优于迭代思维链提示在面试回答质量上的表现

Kewen Zhu, Zixi Liu, Yanjing Li, Jing Chen

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比人类在环和自动思维链提示方法,发现人类在环在面试回答质量评估中表现更优,且迭代次数更少,同时具有更高的训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13554 2026-06-09 cs.CL cs.LG 版本更新 86%

Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization

注意力揭示大语言模型推理:预规划与锚定节奏实现细粒度策略优化

Yang Li, Zhichen Dong, Yuhan Sun, Weixun Wang, Shaopan Xiong, Yijia Luo, Jiashun Liu, Han Lu, Jiamang Wang, Wenbo Su, Bo Zheng, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过注意力机制揭示大语言模型推理中的预规划与锚定节奏,并据此提出三种细粒度强化学习策略,在多种推理任务上取得一致性能提升。

Comments 31 pages, 9 figures, 20 tables. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06635 2026-06-08 cs.CL cs.AI 新提交 86%

How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures

语言模型如何失败:承诺性和持续性推理错误的令牌级特征

Tanvi Thoria, Kiana Jafari, Marc R. Schlichting, Mykel J. Kochenderfer

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) Department of Aeronautics and Astronautics, Stanford University(航空航天工程系,斯坦福大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 通过令牌级不确定性信号,将语言模型推理失败分为承诺性失败(早期锁定错误路径)和持续性不确定性(不确定性持续累积),并在23个模型-数据集配置中验证了可预测性,为自我一致性策略提供了指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05402 2026-06-05 cs.CL cs.AI 86%

ReasoningFlow: Discourse Structures for Understanding LLM Reasoning Traces

ReasoningFlow: 理解LLM推理轨迹的话语结构

Jinu Lee, Shivam Agarwal, Amruta Parulekar, Siddarth Madala, Dilek Hakkani-Tur, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出ReasoningFlow框架,将大推理模型的推理轨迹建模为细粒度有向无环图,通过人工和自动标注分析发现模型间结构相似性、多样化推理行为及错误步骤与最终答案的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03304 2026-06-03 cs.CL cs.LG 86%

From Script to Semantics: Prompting Strategies for African NLI

从脚本到语义:非洲自然语言推理的提示策略

Anuj Tiwari, Terry Oko-odion, Hannah Nwokocha

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究系统评估了五种提示策略在斯瓦希里语、约鲁巴语和豪萨语的自然语言推理任务上的表现,发现对比提示策略最可靠且能显著提升模型性能。

Comments Accepted at the RAIL Workshop, LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02372 2026-06-02 cs.AI cs.CL 86%

COMAP: Co-Evolving World Models and Agent Policies for LLM Agents

COMAP:面向LLM智能体的世界模型与智能体策略协同进化

Youwei Liu, Jian Wang, Hanlin Wang, Wenjie Li

机构 * Central South University(中南大学) College of Computer Science, Sichuan University(四川大学计算机学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 推理与问题求解 :LLM(title,title_cn);language agent(abstract);分类 cs.CL、cs.AI

AI总结 提出COMAP框架,通过闭环交互协同进化文本世界模型和智能体策略,在具身任务规划、网页导航和工具使用基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28014 2026-05-28 cs.CL cs.LG 86%

ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains

ROSD: 面向跨领域语言模型推理的反思式同策略自蒸馏

Ziqi Zhao, Xinyu Ma, Liu Yang, Yujie Feng, Daiting Shi, Jingzhou He, Xin Xin, Zhaochun Ren, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Baidu Inc.(百度公司) Shandong University(山东大学) Leiden University(莱顿大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.LG

AI总结 提出反思式同策略自蒸馏(ROSD)框架,通过反思引导的错误定位蒸馏将参考解模仿转为针对性推理修正,提升领域内推理和跨领域泛化能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25133 2026-05-26 cs.AI cs.CL 86%

Trust but Verify: Prover-Verifier Deliberation for Selective LLM Prediction

信任但验证:面向选择性LLM预测的证明者-验证者审议

João Sedoc, Baotong Zhang, Dean Foster

机构 * New York University(纽约大学)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出基于交互式证明理论的证明者-验证者审议协议,通过结构化置信度判定实现选择性预测,在GPQA Diamond上取得约30个百分点的高置信度精确率差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01683 2026-05-19 cs.CL cs.AI 86%

Surgical Post-Training: Proximal On-Policy Distillation for Reasoning with Knowledge Retention

手术式后训练:用于知识保留的近端策略蒸馏

Wenye Lin, Kai Han

机构 * The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SPOT框架,通过近端策略蒸馏在后训练中保留知识,提升推理性能,实验表明其在少量数据下显著提升模型准确率。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15044 2026-05-15 cs.SD cs.AI cs.LG cs.MM eess.AS 86%

SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning

SpeakerLLM:一种面向说话人理解与验证推理的说话人专用音频大语言模型

KiHyun Nam, Jungwoo Heo, Siu Bae, Ha-Jin Yu, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) University of Seoul(首尔大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SpeakerLLM通过统一说话人特征建模、录音条件理解及验证推理,提升音频大语言模型在说话人识别与验证中的性能与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09490 2026-05-12 cs.CL cs.AR cs.LG 86%

Not All Thoughts Need HBM: Semantics-Aware Memory Hierarchy for LLM Reasoning

并非所有思考都需要HBM:面向LLM推理的语义感知内存层次结构

Aojie Yuan, Tianqi Shen, Dajun Zhang

机构 * University of Southern California(南加州大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出一种语义感知内存层次结构,通过累积注意力评分将token分为四个层级,减少HBM占用并提升推理准确性,实验表明仅3%的淘汰率可保持91%的GSM8K准确率。

Comments Preprint. 14 pages + appendix. Under review at AdaptFM Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03916 2026-05-12 cs.CV cs.CE cs.CL cs.LG 86%

SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?

SpatiaLab: 视觉-语言模型能否在真实环境中进行空间推理?

Azmine Toushik Wasi, Wahid Faisal, Abdur Rahman, Mahfuz Ahmed Anik, Munem Shahriar, Mohsin Mahmud Topu, Sadia Tasnim Meem, Rahatun Nesa Priti, Sabrina Afroz Mitu, Md. Iqramul Hoque, Shahriyar Zaman Ridoy, Mohammed Eunus Ali, Majd Hawasly, Mohammad Raza, Md Rizwan Parvez

机构 * Computational Intelligence and Operations Laboratory(计算智能与运筹实验室) Shahjalal University of Science and Technology(沙赫jalal科技大学) BRAC University(BRAC大学) North South University(北南大学) Monash University(墨尔本大学) Qatar Computing Research Institute(卡塔尔计算研究院)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 SpatiaLab通过真实场景下的空间推理任务评估视觉-语言模型的能力,揭示其在复杂空间关系、深度感知和3D几何方面的不足。

Comments Accepted to ICLR 2026 (https://openreview.net/forum?id=fWWUPOb0CT). 92 Pages. 42 Figures and 29 Tables

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09168 2026-05-12 cs.AI cs.LG 86%

CIVeX: Causal Intervention Verification for Language Agents

CIVeX:语言代理的因果干预验证

Fabio Rovai

机构 * The Tesseract Academy(泰塞克特学院)

专题命中 推理与问题求解 :language agent(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 CIVeX通过结构因果查询验证语言代理的干预行动,解决因果效应识别问题,实验显示其在对抗性混淆下具有高准确性和可靠性。

Comments 16 pages, 3 figures. Includes Causal-ToolBench, IHDP, ZOZO Open Bandit, and LaLonde NSW evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06908 2026-05-11 cs.LG cs.AI 86%

Same Signal, Opposite Meaning: Direction-Informed Adaptive Learning for LLM Agents

同信号,异意义:方向感知的自适应学习用于大语言模型代理

Ziming Li, Jiatan Huang, Xiaoguang Guo, Guilin Wang, Chuxu Zhang

机构 * University of Connecticut(康奈尔大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 本文提出DIAL方法,通过方向感知的自适应学习解决LLM代理中计算需求与计算适宜性差异问题,提升性能-成本平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01569 2026-05-11 cs.AI cs.CL 86%

InvThink: Premortem Reasoning for Safer Language Models

InvThink:用于更安全语言模型的预mortem推理

Yubin Kim, Taehan Kim, Eugene Park, Chunjong Park, Cynthia Breazeal, Daniel McDuff, Hae Won Park

机构 * MIT(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Samsung Research(三星研究)

专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 InvThink通过预mortem推理框架提升语言模型安全性,通过枚举、分析和约束潜在故障来生成响应,相比现有方法在安全性和减少有害行为方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05873 2026-05-08 stat.ML cs.AI cs.LG math.ST stat.ME stat.TH 86%

CITE: Anytime-Valid Statistical Inference in LLM Self-Consistency

CITE: 在大语言模型自我一致性中实现任意时间有效的统计推断

Hirofumi Ota, Naoto Iwase, Yuki Ichihara, Junpei Komiyama, Masaaki Imaizumi

机构 * Komaba Institute for Science, Graduate School of Arts and Sciences, The University of Tokyo(东京大学艺术科学研究生院Komaba研究所) Nagoya University(名古屋大学) NARA Institute of Science and Technology (NAIST) / Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(NAIST科学与技术研究所 / 摩洛哥本·泽德人工智能大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI) / RIKEN AIP(摩洛哥本·泽德人工智能大学 / RIKEN AIP) Graduate School of Arts and Sciences, The University of Tokyo / RIKEN AIP / Kyoto University(东京大学艺术科学研究生院 / RIKEN AIP / 京都大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CITE算法,通过交并检验与E过程实现任意时间有效的模型响应分布唯一模式认证,无需预先知道可能答案集,并在扩散尾设置中提升认证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01048 2026-05-05 cs.CL cs.LG 86%

Compared to What? Baselines and Metrics for Counterfactual Prompting

与什么相比?反事实提示的基线和度量标准

Zihao Yang, Mosh Levy, Yoav Goldberg, Byron C. Wallace

机构 * Northeastern University(东北大学) Bar-Ilan University(巴伊兰大学) Allen Institute for AI(人工智能研究所)

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文探讨了反事实提示中基线和度量标准的重要性,指出单纯改变文本因素无法准确评估模型敏感性,提出通过统计检验比较干预差异与改写影响的框架,发现模型对患者性别等的敏感性在考虑一般模型敏感性后显著降低。

Comments 24 pages, 10 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09870 2026-04-30 cs.HC cs.AI cs.CL 86%

Vibe Check: Understanding the Effects of LLM-Based Conversational Agents' Personality and Alignment on User Perceptions in Goal-Oriented Tasks

Vibe Check: 探讨基于大语言模型的对话代理的性格和对齐对用户在目标导向任务中的感知影响

Hasibur Rahman, Smit Desai

机构 * Northeastern University(东北大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了对话代理性格表达水平和用户与代理性格对齐如何影响用户在目标导向任务中的感知,发现中等表达水平在多个维度上表现最佳,性格对齐进一步提升了结果,尤其在外向性和情绪稳定性和方面影响显著。

Comments 30 pages, CHI 2026 conference paper (article no. 371)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02902 2026-04-16 cs.AI cs.CL cs.LO 86%

Logical Phase Transitions: Understanding Collapse in LLM Logical Reasoning

逻辑相变:理解大语言模型逻辑推理中的崩溃

Xinglang Zhang, Yunyao Zhang, ZeLiang Chen, Junqing Yu, Wei Yang, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过控制逻辑复杂性分析大语言模型的逻辑推理性能,发现逻辑相变现象,提出神经符号课程调优框架以提升高复杂度下的推理能力。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00919 2026-04-15 cs.CL cs.AI 86%

Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving

基于检索增强生成在奥林匹克级物理问题求解中的基础模型评估

Shunfeng Zheng, Yudi Zhang, Meng Fang, Zihan Zhang, Zhitan Wu, Mykola Pechenizkiy, Ling Chen

机构 * AAII, University of Technology Sydney, New South Wales, Australia(AAII,悉尼大学,新南威尔士州,澳大利亚) Eindhoven University of Technology, Eindhoven, The Netherlands(埃因霍温理工大学,埃因霍温,荷兰) University of Liverpool, Liverpool, United Kingdom(利物浦大学,利物浦,英国) University of New South Wales, New South Wales, Australia(新南威尔士大学,新南威尔士州,澳大利亚)

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过PhoPile多模态数据集评估检索增强生成在奥林匹克级物理问题求解中的表现,探讨了基础模型结合检索与物理语料对性能提升的影响及存在的挑战。

Comments Accepted to EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11791 2026-04-14 cs.LG cs.AI 86%

A Mechanistic Analysis of Looped Reasoning Language Models

循环推理语言模型的机理分析

Hugh Blayney, Álvaro Arroyo, Johan Obando-Ceron, Pablo Samuel Castro, Aaron Courville, Michael M. Bronstein, Xiaowen Dong

机构 * University of Oxford(牛津大学) Mila – Quebec AI Institute(魁北克AI研究所)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文分析了循环推理语言模型中潜在状态的机理,揭示了循环块在潜在空间中的稳定轨迹及注意力头行为的稳定特性。

Comments 39 pages, 63 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11209 2026-04-14 cs.CL cs.AI 86%

Exploring Knowledge Conflicts for Faithful LLM Reasoning: Benchmark and Method

探索知识冲突以实现忠实的LLM推理:基准与方法

Tianzhe Zhao, Jiaoyan Chen, Shuxiu Zhang, Haiping Zhu, Qika Lin, Jun Liu

机构 * School of Computer Science and Technology, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Hunan University(湖南大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出ConflictQA基准,揭示LLM在处理跨源知识冲突时的不足,并提出XoT框架以提升异构冲突证据推理的可靠性。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08588 2026-04-13 cs.LG cs.AI 86%

Act or Escalate? Evaluating Escalation Behavior in Automation with Language Models

行动或升级?基于语言模型评估自动化中的升级行为

Matthew DosSantos DiSorbo, Harang Ju

机构 * Harvard Business School(哈佛商学院) Johns Hopkins Carey Business School(约翰霍普金斯大学凯瑞商学院)

专题命中 推理与问题求解 :language model(title);LLM(abstract);SFT(abstract);prompting(abstract)

AI总结 本文研究了语言模型在自动化决策中如何平衡行动与升级,发现模型在成本权衡上的隐含阈值存在显著差异,且自我评估存在偏差,通过干预测试发现链式思维训练能产生稳健的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏