arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-25 至 2026-02-25 共收录 83 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 21 篇

2602.12876 2026-02-25 cs.AI 70%

BrowseComp-$V^3$: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents

BrowseComp-$V^3$:一种视觉、垂直和可验证的多模态浏览代理基准测试

Huanyao Zhang, Jiepeng Zhou, Bo Li, Bowen Zhou, Yanzhe Shan, Haishan Lu, Zhiyong Cao, Jiaoyang Chen, Yuqian Han, Zinan Sheng, Zhengwei Tao, Hao Liang, Jialong Wu, Yang Shi, Yuanpeng He, Jiaye Lin, Qintong Zhang, Guochen Yan, Runhao Zhao, Zhengpin Li, Xiaohan Yu, Lang Mei, Chong Chen, Wentao Zhang, Bin Cui

机构 * PKU(北京大学) HKUST(GZ)(香港科技大学) OUC(华侨大学) CASIA(中国科学院自动化研究所) HITSZ(哈尔滨工业大学) THU(清华大学) Huawei Cloud BU(华为云业务部)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 BrowseComp-$V^3$提出了一种多模态浏览代理基准测试,通过300个跨模态问题评估深度搜索能力,揭示多模态信息整合的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21143 2026-02-25 cs.AI cs.CL cs.IR cs.LG 67%

A Benchmark for Deep Information Synthesis

深度信息合成的基准测试

Debjit Paul, Daniel Murphy, Milan Gritta, Ronald Cardenas, Victor Prokhorov, Lena Sophia Bolliger, Aysim Toker, Roy Miles, Andreea-Maria Oncescu, Jasivan Alex Sivakumar, Philipp Borchert, Ismail Elezi, Meiru Zhang, Ka Yiu Lee, Guchun Zhang, Jun Wang, Gerasimos Lampouras

机构 * Huawei Noah’s Ark Lab, UK(华为诺亚实验室,英国) Imperial College London(伦敦帝国理工学院) UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心) University of Zurich(苏黎世大学) University of Sheffield(谢菲尔德大学) University of Cambridge(剑桥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DEEPSYNTH是一个评估智能体在复杂任务中信息合成与推理能力的新基准测试,通过多阶段数据收集流程和120个跨7个领域的任务,评估LLM在现实问题中的表现。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10385 2026-02-25 cs.CL cs.AI cs.IR cs.LG 67%

Augmenting Lateral Thinking in Language Models with Humor and Riddle Data for the BRAINTEASER Task

通过幽默和谜语数据增强语言模型的横向思维以完成BRAINTEASER任务

Mina Ghashami, Soumya Smruti Mishra

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过引入幽默和谜语数据增强语言模型,提升其在BRAINTEASER任务中的横向推理能力,提高句子谜题和词语谜题的准确率。

Comments Accepted at SemEval 2024 (Colocated with NAACL 2024)

Journal ref Proceedings of the 18th International Workshop on Semantic Evaluation (SemEval-2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20164 2026-02-25 cs.CL cs.LG 62%

Benchmarking Distilled Language Models: Performance and Efficiency in Resource-Constrained Settings

评估压缩语言模型:在资源受限环境中的性能与效率

Sachin Gopal Wani, Eric Page, Ajay Dholakia, David Ellison

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过对比蒸馏模型与原始模型,验证了蒸馏在资源受限环境下提升性能与效率的优越性。

Comments 16 pages, 5 figures, accepted at the the 2025 TPCTC Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20162 2026-02-25 cs.CL cs.AI 62%

Talking to Yourself: Defying Forgetting in Large Language Models

与自己对话:在大型语言模型中克服遗忘

Yutao Sun, Mingshuai Chen, Tiancheng Zhao, Phillip Miao, Zilun Zhang, Haozhan Shen, Ruizhe Zhu, Jianwei Yin

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院) Om AI Research(奥姆人工智能研究) Stanford University(斯坦福大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SA-SFT方法,通过让LLM生成自我对话来缓解微调过程中的灾难性遗忘,提升领域性能并优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22620 2026-02-25 cs.CR cs.AI cs.LG 62%

Breaking Agent Backbones: Evaluating the Security of Backbone LLMs in AI Agents

打破代理骨干:评估AI代理中骨干LLM的安全性

Julia Bazinska, Max Mathys, Francesco Casucci, Mateo Rojas-Carulla, Xander Davies, Alexandra Souly, Niklas Pfister

机构 * Lakera AI ETH Zürich(苏黎世联邦理工学院) UK AI Security Institute(英国人工智能安全研究所) OATML, University of Oxford(OATML,牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出威胁快照框架,用于评估AI代理中LLM骨干的安全性,通过构建$b^3$基准测试揭示LLM安全性的关键影响因素。

Comments Julia Bazinska and Max Mathys contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14685 2026-02-25 cs.CL 57%

Language Models use Lookbacks to Track Beliefs

语言模型使用回溯来跟踪信念

Nikhil Prakash, Natalie Shapira, Arnab Sen Sharma, Christoph Riedl, Yonatan Belinkov, Tamar Rott Shaham, David Bau, Atticus Geiger

机构 * Northeastern University(东北大学) Technion(技术学院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Goodfire Pr(Ai) 2 R Group(Pr(Ai) 2 R集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究揭示语言模型通过回溯机制跟踪角色信念的算法模式,通过构建CausalToM数据集,分析LM在因果中介和抽象中的推理能力,并探讨可见性对信念更新的影响。

Comments 38 pages, 50 figures. Code and data at https://belief.baulab.info/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20424 2026-02-25 cs.AI 57%

Implicit Intelligence -- Evaluating Agents on What Users Don't Say

隐式智能 -- 评估代理在用户未言明之事上的能力

Ved Sirdeshmukh, Marc Wetter

机构 * Applied Machine Learning Research(应用机器学习研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 隐式智能框架评估AI代理在未明示约束下的推理能力,通过交互式世界模拟发现代理在复杂情境下的表现有限,揭示了改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20333 2026-02-25 cs.AI 57%

DMCD: Semantic-Statistical Framework for Causal Discovery

DMCD:基于语义-统计的因果发现框架

Samarth KaPatel, Sofia Nikiforova, Giacinto Paolo Saggese, Paul Smith

机构 * Causify AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DMCD通过结合语义引导的先验和统计验证,实现了在因果发现任务中的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03475 2026-02-25 cs.LG 57%

ContextPilot: Fast Long-Context Inference via Context Reuse

ContextPilot: 通过上下文重用实现快速长上下文推断

Yinsicheng Jiang, Yeqi Huang, Liang Cheng, Cheng Deng, Xuan Sun, Luo Mai

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 ContextPilot通过引入上下文重用机制,显著提升长上下文推断效率,减少延迟并保持推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05598 2026-02-25 cs.IR cs.AI 57%

AgentDR: Dynamic Recommendation with Implicit Item-Item Relations via LLM-based Agents

AgentDR: 通过基于LLM的代理进行动态推荐:利用隐式物品-物品关系

Mingdai Yang, Nurendra Choudhary, Jiangshu Du, Edward W. Huang, Philip S. Yu, Karthik Subbian, Danai Koutra

机构 * Amazon(亚马逊) University of Michigan(密歇根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AgentDR通过基于LLM的代理利用隐式物品-物品关系,结合记忆机制和提示策略,提升动态推荐的全排名性能和相关性。

Comments 12 pages, accepted by WWW'26 as long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00628 2026-02-25 cs.SD cs.CL 57%

Hearing the Order: Investigating Position Bias in Large Audio-Language Models

听序:探究大型音频-语言模型中的位置偏差

Yu-Xiang Lin, Chen-An Li, Sheng-Lun Wei, Po-Chun Chen, Hsin-Hsi Chen, Hung-yi Lee

机构 * National Taiwan University(台湾大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文首次系统研究了大型音频-语言模型中位置偏差问题,通过实验发现答案选项顺序影响模型性能,提出基于排列的策略可缓解偏差。

Comments The first two authors contributed equally. Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23434 2026-02-25 cs.LG 57%

Towards Trustworthy GUI Agents: A Survey

迈向可信的GUI代理:综述

Yucheng Shi, Wenhao Yu, Jingyuan Huang, Wenlin Yao, Wenhu Chen, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Tencent AI Seattle Lab(腾讯AI西雅图实验室) Microsoft Research(微软研究院) University of Waterloo(滑铁卢大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文综述了GUI代理的可信度挑战,提出信任分类法并分析了信任评估与安全可靠部署的开放问题。

Comments 14 pages, work in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21099 2026-02-25 cs.IR 50%

Turning Semantics into Topology: LLM-Driven Attribute Augmentation for Collaborative Filtering

将语义转化为拓扑:基于LLM的属性增强协同过滤

Junjie Meng, Ranxu zhang, Wei Wu, Rui Zhang, Chuan Qin, Qi Zhang, Qi Liu, Hui Xiong, Chao Wang

专题命中 推理评测 :reasoning(abstract)

AI总结 基于LLM的属性增强协同过滤框架,通过拓扑连接性转换语义知识,提升协同过滤效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20446 2026-02-25 cs.CR 50%

Understanding Human-AI Collaboration in Cybersecurity Competitions

理解网络安全竞赛中的人机协作

Tingxuan Tang, Nicolas Janis, Kalyn Asher Montague, Kevin Eykholt, Dhilung Kirat, Youngja Park, Jiyong Jang, Adwait Nadkarni, Yue Xiao

专题命中 推理评测 :reasoning(abstract)

AI总结 研究探讨了网络安全竞赛中人类与AI协作的有效性,发现AI代理在自主引导提示和工具使用时能超越多数人类团队。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 8 篇

2601.19001 2026-02-25 cs.CL cs.AI cs.LG 82%

FROST: Filtering Reasoning Outliers with Attention for Efficient Reasoning

FROST:利用注意力过滤异常以实现高效推理

Haozheng Luo, Zhuolin Jiang, Md Zahid Hasan, Yan Chen, Soumalya Sarkar

机构 * Department of Computer Science, Northwestern University, Evanston, IL 60208 USA(西北大学计算机科学系) RTX Technology Research Center (RTRC), East Hartford, CT 06118 USA(RTX技术研究中心) Department of Electrical and Computer Engineering, Iowa State University, Ames, IA 50011 USA(爱荷华州立大学电气与计算机工程系)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FROST通过引入注意力机制过滤推理异常,提升推理效率和准确性,减少token使用并提高模型性能。

Comments International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17645 2026-02-25 cs.CV cs.AI cs.CL cs.LG cs.MM 82%

HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning

HoloLLM:面向语言基础的人感知与推理的多感官基础模型

Chuhao Zhou, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HoloLLM通过整合LiDAR、红外、毫米波雷达和Wi-Fi等多感官数据,提升语言基础的人感知与推理能力,实验表明其在真实场景中的性能提升达30%。

Comments Camera-ready version. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20966 2026-02-25 cs.CL 57%

Blackbird Language Matrices: A Framework to Investigate the Linguistic Competence of Language Models

黑鸟语言矩阵:一种研究语言模型语言能力的框架

Paola Merlo, Chunyang Jiang, Giuseppe Samo, Vivi Nastase

机构 * Idiap Research Institute(Idiap研究机构) University of Geneva(日内瓦大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 黑鸟语言矩阵通过结构化数据集研究语言模型的语言能力与系统性模式识别

Comments Under review, 46 pages, 5 tables, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14044 2026-02-25 cs.CL 57%

Context Shapes LLMs Retrieval-Augmented Fact-Checking Effectiveness

上下文影响基于LLM的检索增强事实核查效果

Pietro Bernardelle, Stefano Civelli, Kevin Roitero, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学) University of Udine(乌迪内大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究探讨了上下文对LLM检索增强事实核查效果的影响,发现上下文长度和证据位置显著影响验证准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05182 2026-02-25 cs.CL 57%

The Single-Multi Evolution Loop for Self-Improving Model Collaboration Systems

单一-多进化循环用于自我改进的模型协作系统

Shangbin Feng, Kishan Panaganti, Yulia Tsvetkov, Wenhao Yu

机构 * University of Washington(华盛顿大学) Tencent AI Seattle Lab(腾讯AI西雅图实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出单一-多进化循环,通过模型协作与蒸馏实现自我改进,提升模型性能与效率。

Comments Code at https://github.com/BunsenFeng/moco_distill

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12007 2026-02-25 cs.IR cs.AI 57%

Diffusion Generative Recommendation with Continuous Tokens

基于连续令牌的扩散生成推荐

Haohao Qu, Shanru Lin, Yujuan Ding, Yiqi Wang, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学) National University of Defense Technology(国防科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 ContRec通过整合连续令牌和扩散模型,提升基于LLM的推荐系统性能。

Comments Accepted by The ACM Web Conference (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19275 2026-02-25 cs.CR 50%

KUDA: Knowledge Unlearning by Deviating Representation for Large Language Models

KUDA: 通过偏离表示进行大语言模型的知识卸载

Ce Fang, Zhikun Zhang, Min Chen, Qing Liu, Lu Zhou, Zhe Liu, Yunjun Gao

专题命中 其他推理 :reasoning(abstract)

AI总结 KUDA通过偏离表示方法实现大语言模型的知识卸载,有效平衡知识移除与模型实用性保留。

Comments 24 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02002 2026-02-25 cs.RO 50%

LLM-Driven Corrective Robot Operation Code Generation with Static Text-Based Simulation

基于大型语言模型的纠正性机器人操作代码生成与静态文本模拟

Wenhao Wang, Yi Rong, Yanyan Li, Long Jiao, Jiawei Yuan

机构 * Department of CIS, University of Massachusetts Dartmouth(大学马萨诸塞州达特茅斯分校计算机信息科学系) Department of CSIS, California State University San Marcos(加州州立大学桑马科斯分校计算机科学与信息系统系)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出了一种基于LLM的纠正性机器人操作代码生成框架,利用静态文本模拟提升代码生成的可靠性,无需依赖动态执行环境。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏