arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-20 至 2026-02-20 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 14 篇

2602.17544 2026-02-20 cs.AI cs.CL cs.IR 90%

Evaluating Chain-of-Thought Reasoning through Reusability and Verifiability

通过可重用性和可验证性评估链式推理

Shashank Aggarwal, Ram Vikas Mishra, Amit Awekar

机构 * Indian Institute of Technology(印度理工学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过可重用性和可验证性评估链式推理的质量,发现专门推理模型并不始终优于通用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16928 2026-02-20 cs.AI cs.LG cs.RO 84%

Beyond Needle(s) in the Embodied Haystack: Environment, Architecture, and Training Considerations for Long Context Reasoning

超越实体 haystack 中的针(针):环境、架构和训练考虑因素在长上下文推理中的应用

Bosung Kim, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 $\infty$-THOR 框架,通过长上下文推理任务和数据集提升实体 AI 的长期推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17520 2026-02-20 cs.AR 82%

When Models Ignore Definitions: Measuring Semantic Override Hallucinations in LLM Reasoning

当模型忽略定义:在LLM推理中测量语义覆盖幻觉

Yogeswar Reddy Thota, Setareh Rafatirad, Homayoun Houman, Tooraj Nikoubin

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract)

AI总结 本研究探讨了LLM在局部语义重新定义时的失败模式,发现模型常回归预训练默认解释,提出微基准测试以评估其语义合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17183 2026-02-20 cs.SE cs.AI 79%

Robustness and Reasoning Fidelity of Large Language Models in Long-Context Code Question Answering

大语言模型在长上下文代码问答中的鲁棒性与推理可信度

Kishan Maharaj, Nandakishore Menon, Ashita Saxena, Srikanth Tamilselvam

机构 * IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究评估了大语言模型在长上下文代码问答中的鲁棒性和推理可信度,通过不同设置测试发现模型在面对干扰信息时表现脆弱,揭示了现有评估的局限性。

Comments 11 pages, 4 Figures, 5 Tables, Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17169 2026-02-20 cs.AR 75%

SimulatorCoder: DNN Accelerator Simulator Code Generation and Optimization via Large Language Models

SimulatorCoder: 基于大语言模型的DNN加速器模拟器代码生成与优化

Yuhuan Xia, Tun Li, Hongji Zhou, Xianfa Zhou, Chong Chen, Ruiyu Zhang

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 SimulatorCoder利用大语言模型生成并优化DNN加速器模拟器代码,通过结构化提示和反馈机制提升代码准确性和模拟性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16802 2026-02-20 cs.CL cs.AI cs.LG 67%

References Improve LLM Alignment in Non-Verifiable Domains

参考文献提高非可验证领域的LLM对齐

Kejian Shi, Yixin Liu, Peifeng Wang, Alexander R. Fabbri, Shafiq Joty, Arman Cohan

机构 * Yale University(耶鲁大学) Meta Scale AI Salesforce Research(Salesforce 研究) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出参考引导的LLM评估器,通过增强LLM对齐的评估器和自我改进,显著提升了非可验证领域中LLM的性能。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12026 2026-02-20 cs.AI cs.CV cs.LG 62%

Bongard-RWR+: Real-World Representations of Fine-Grained Concepts in Bongard Problems

Bongard-RWR+: Bongard问题中细粒度概念的现实世界表示

Szymon Pawlonka, Mikołaj Małkiński, Jacek Mańdziuk

机构 * Warsaw University of Technology(华沙技术大学) AGH University of Krakow(克拉科夫AGH大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Bongard-RWR+数据集,通过视觉语言模型生成现实世界图像,评估VLMs在细粒度概念识别中的局限性。

Comments Accepted to The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17623 2026-02-20 cs.CL 57%

Unmasking the Factual-Conceptual Gap in Persian Language Models

揭示波斯语言模型中的事实-概念鸿沟

Alireza Sakhaeirad, Ali Ma'manpoosh, Arshia Hemmat

机构 * EPFL(瑞士联邦理工学院) University of Isfahan(伊斯法罕大学) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过DivanBench揭示波斯语言模型在文化常识推理上的不足,发现模型在处理迷信和习俗问题时存在严重偏差,且预训练并未提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17594 2026-02-20 cs.AI 57%

AI Gamestore: Scalable, Open-Ended Evaluation of Machine General Intelligence with Human Games

AI 游戏商店:通过人类游戏评估机器通用智能的可扩展性和开放性

Lance Ying, Ryan Truong, Prafull Sharma, Kaiya Ivy Zhao, Nathan Cloos, Kelsey R. Allen, Thomas L. Griffiths, Katherine M. Collins, José Hernández-Orallo, Phillip Isola, Samuel J. Gershman, Joshua B. Tenenbaum

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 通过AI GameStore评估机器通用智能,利用人类游戏测试AI在游戏中的表现,发现其在复杂游戏任务中表现不佳。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23482 2026-02-20 cs.RO cs.AI 57%

Theory of Mind for Explainable Human-Robot Interaction

可解释人机交互中的理论思维

Marie S. Bauer, Julia Gachot, Matthias Kerzel, Cornelius Weber, Stefan Wermter

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出将理论思维视为可解释人工智能的一种形式,通过XAI框架评估其在人机交互中的应用,并强调以用户为中心的解释方法。

Comments Accepted at the workshop on Theory of Mind for Artificial Intelligence (ToM4AI) at AAAI 2026

Journal ref Theory of Mind for Artificial Intelligence (ToM4AI) at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17222 2026-02-20 cs.AI 57%

Decoding the Human Factor: High Fidelity Behavioral Prediction for Strategic Foresight

解码人类因素:为战略预见的高保真行为预测

Ben Yellin, Ehud Ezra, Mark Foreman, Shula Grinapol

机构 * OMGene AI Lab(OMGene AI实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LBM模型,通过高维特质轮廓预测个体战略选择,提升高保真行为模拟能力,应用于战略预见等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17259 2026-02-20 cs.RO 50%

FRAPPE: Infusing World Modeling into Generalist Policies via Multiple Future Representation Alignment

FRAPPE:通过多未来表示对齐将世界建模注入通用策略

Han Zhao, Jingbo Wang, Wenxuan Song, Shuai Chen, Yang Liu, Yan Wang, Haoang Li, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) South China University of Technology(华南理工大学) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 FRAPPE通过多未来表示对齐提升通用机器人策略的世界建模能力,提高微调效率并减少数据依赖,实验证明其在长时序和未见场景中的泛化性能优于现有方法。

Comments Project Website: https://h-zhao1997.github.io/frappe

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16858 2026-02-20 cs.PF cs.AR 50%

GDEV-AI: A Generalized Evaluation of Deep Learning Inference Scaling and Architectural Saturation

GDEV-AI: 对深度学习推理扩展性和架构饱和度的通用评估

Kathiravan Palaniappan

专题命中 推理评测 :planning(abstract)

AI总结 GDEV-AI通过基准测试分析CPU推理的可扩展性和架构饱和度,揭示传统CPU和现代架构在吞吐量和延迟上的差异,为异构数据中心的容量规划提供实证支持。

Comments 14 pages, 18 figures, 20 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16756 2026-02-20 cs.CR cs.SE 50%

NESSiE: The Necessary Safety Benchmark -- Identifying Errors that should not Exist

NESSiE: 必要安全基准 -- 识别不应存在的错误

Johannes Bertram, Jonas Geiping

专题命中 推理评测 :reasoning(abstract)

AI总结 NESSiE提出了一种轻量级安全基准,用于检测大型语言模型中不应存在的安全故障,揭示模型在帮助与安全之间的偏差。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏