arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-13 至 2026-01-13 共收录 149 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 21 篇

2601.06054 2026-01-13 cs.CL cs.AI 81%

A Multi-Stage Workflow for the Review of Marketing Content with Reasoning Large Language Models

一种基于推理大语言模型的多阶段营销内容审查工作流程

Alberto Purpura, Emily Chen, Swapnil Shinde

机构 * AI Foundations, Capital One(人工智能基础,Capital One)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于推理大语言模型的多阶段工作流程,用于自动审查营销内容的合规性,并评估不同微调策略和奖励函数对模型性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03519 2026-01-13 cs.RO 80%

A Vision-Language-Action Model with Visual Prompt for OFF-Road Autonomous Driving

一种具有视觉提示的视觉-语言-动作模型用于越野自动驾驶

Liangdong Zhang, Yiming Nie, Haoyang Li, Fanjie Kong, Baobao Zhang, Shunxin Huang, Kai Fu, Chen Min, Liang Xiao

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 本文提出OFF-EMMA模型,通过视觉提示和COT-SC策略提升越野自动驾驶轨迹规划的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06974 2026-01-13 cs.CL 79%

UETQuintet at BioCreative IX -- MedHopQA: Enhancing Biomedical QA with Selective Multi-hop Reasoning and Contextual Retrieval

UETQuintet在BioCreative IX上的MedHopQA:通过选择性多跳推理和上下文检索增强生物医学问答

Quoc-An Nguyen, Thi-Minh-Thu Vu, Bich-Dat Nguyen, Dinh-Quang-Minh Tran, Hoang-Quynh Le

机构 * VNU University of Engineering and Technology(越南工程大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MedHopQA模型,通过选择性多跳推理和上下文检索提升生物医学问答性能,在BioCreative IX共享任务中取得第二名成绩。

Comments In Proceedings of the BioCreative IX Challenge and Workshop (BC9): Large Language Models for Clinical and Biomedical NLP, IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14319 2026-01-13 cs.AI 79%

Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction

多智能体系统中的元认知自我校正:通过原型引导的下一步执行重建

Xu Shen, Qi Zhang, Song Wang, Zhen Tan, Xinyu Zhao, Laura Yao, Vaishnav Tadiparthi, Hossein Nourkhiz Mahjoub, Ehsan Moradi Pari, Kwonjoon Lee, Tianlong Chen

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.AI

AI总结 本文提出MASC框架,通过原型引导和下一步执行重建实现多智能体系统的元认知自我校正,有效提升错误检测精度并减少误差传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13130 2026-01-13 cs.CL 79%

MuDRiC: Multi-Dialect Reasoning for Arabic Commonsense Validation

MuDRiC:多方言推理用于阿拉伯常识验证

Kareem Elozeiri, Mervat Abassy, Preslav Nakov, Yuxia Wang

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 MuDRiC通过引入多方言阿拉伯语常识数据集和图卷积网络方法,提升阿拉伯语常识验证性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16787 2026-01-13 cs.CL cs.AI 73%

Credible Plan-Driven RAG Method for Multi-Hop Question Answering

可信计划驱动的RAG方法用于多跳问答

Ningning Zhang, Chi Zhang, Zhizhong Tan, Xingxing Yang, Weiping Deng, Wenyong Wang

机构 * Macau University of Science and Technology(澳门科学技术大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 PAR-RAG通过引入复杂性感知的计划生成和双验证机制,提升了多跳问答任务中的推理稳定性和事实一致性,实现了更可靠的问答性能。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06678 2026-01-13 cs.DB 71%

Reflective Reasoning for SQL Generation

面向SQL生成的反思推理

Isabelle Mohr, Joao Gandarela, John Dujany, Andre Freitas

专题命中 复杂问题求解 :reasoning(title)

AI总结 本文提出了一种基于反思细化的文本到SQL框架,通过阶段化生成和反馈机制提升SQL生成的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08521 2026-01-13 cs.AI 70%

FlowSearch: Advancing deep research with dynamic structured knowledge flow

FlowSearch: 通过动态结构化知识流推进深度研究

Yusong Hu, Runmin Ma, Yue Fan, Jinxin Shi, Zongsheng Cao, Yuhao Zhou, Jiakang Yuan, Shuaiyu Zhang, Shiyang Feng, Xiangchao Yan, Shufei Zhang, Wenlong Zhang, Lei Bai, Bo Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 FlowSearch通过动态结构化知识流提升多智能体系统在复杂任务中的推理与执行能力,实现跨学科研究的有效推进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07779 2026-01-13 cs.MA cs.AI cs.CL cs.CV cs.HC 62%

OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent

OS-Symphony: 一个用于鲁棒且通用计算机使用代理的综合框架

Bowen Yang, Kaiming Jin, Zhenyu Wu, Zhaoyang Liu, Qiushi Sun, Zehao Li, JingJing Xie, Zhoumianze Liu, Fangzhi Xu, Kanzhi Cheng, Qingyun Li, Yian Wang, Yu Qiao, Zun Wang, Zichen Ding

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) CUHK MMLab(香港中文大学MMLab) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 OS-Symphony通过反思记忆代理和多功能工具代理,提升计算机使用代理在长周期任务和新领域中的鲁棒性和泛化能力。

Comments 31 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07054 2026-01-13 cs.CL cs.LG 62%

Fine-Tuning vs. RAG for Multi-Hop Question Answering with Novel Knowledge

基于新知识的多跳问答中微调与RAG的比较

Zhuoyi Yang, Yurun Song, Iftekhar Ahmed, Ian Harris

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文比较了微调与RAG在多跳问答中处理新颖知识的效果,发现RAG在时间新颖信息问答中表现更优,而有监督微调整体准确率最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06644 2026-01-13 cs.CL cs.AI 62%

Do Language Models Reason Across Languages?

语言模型是否能在不同语言之间进行推理?

Yan Meng, Wafaa Mohammed, Christof Monz

机构 * Language Technology Lab University of Amsterdam(语言技术实验室 阿姆斯特丹大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型在多语言环境下进行推理的能力,提出了一种三阶段提示方法,有效提升了两跳问答任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07263 2026-01-13 cs.CR cs.AI 57%

When Bots Take the Bait: Exposing and Mitigating the Emerging Social Engineering Attack in Web Automation Agent

当机器人上当:揭露和缓解网络自动化代理中新兴的社会工程攻击

Xinyi Wu, Geng Hong, Yueyue Chen, MingXuan Liu, Feier Jin, Xudong Pan, Jiarun Dai, Baojun Liu

机构 * Fudan University(复旦大学) Zhongguancun Laboratory(中关村实验室) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究提出AgentBait攻击范式,揭示网络自动化代理的社会工程威胁,并设计SUPERVISOR模块有效缓解此类攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06914 2026-01-13 cs.CR cs.AI 57%

Towards Compositional Generalization in LLMs for Smart Contract Security: A Case Study on Reentrancy Vulnerabilities

面向智能合约安全的LLM组合泛化:重入漏洞案例研究

Ying Zhou, Jiacheng Wei, Yu Qi, Faguo Wu, Xiao Zhang

机构 * School of Artificial Intelligence, Beijing, China(人工智能学院,北京,中国) Beijing Advanced Innovation Center for Future Blockchain(未来区块链与隐私计算先进创新中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于原子任务分解与融合的后训练算法,通过分解重入漏洞检测任务提升LLM在智能合约安全检测中的准确率与召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05191 2026-01-13 cs.CV cs.LG 57%

AgentCompress: Task-Aware Compression for Affordable Large Language Model Agents

AgentCompress: 任务感知压缩以实现经济高效的大型语言模型代理

Zuhair Ahmed Khan Taha, Mohammed Mudassir Uddin, Shahnawaz Alam

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 AgentCompress通过任务感知动态压缩技术,显著降低大型语言模型的计算成本,同时保持高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04770 2026-01-13 cs.AI cs.DB 57%

SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence

SciIF: 科学指令遵循基准测试以实现严谨的科学智能

Encheng Su, Jianyu Wu, Chen Tang, Lintao Wang, Pengze Li, Aoran Wang, Jinouwen Zhang, Yizhou Wang, Yuan Meng, Xinzhu Ma, Shixiang Tang, Houqiang Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) University of Sydney(悉尼大学) Fudan University(复旦大学) Tsinghua University(清华大学) Beihang University(北航大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 SciIF是一个评估模型在科学问题解决中严格遵守约束条件能力的多学科基准测试,通过显式证据验证科学有效性,提升LLM在科学逻辑框架中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18497 2026-01-13 cs.CL 57%

The Pragmatic Mind of Machines: Tracing the Emergence of Pragmatic Competence in Large Language Models

机器的实用性思维:追踪大型语言模型中实用性能力的出现

Kefan Yu, Qingcheng Zeng, Weihao Xuan, Wanxin Li, Jingyi Wu, Rob Voigt

机构 * Northwestern University(西北大学) The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Zhejiang University(浙江大学) University of California, Davis(加州大学戴维斯分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ALTPRAG数据集,通过对比推理评估不同训练阶段LLMs的实用性能力发展,发现模型规模和数据规模的增加提升其对实用性提示的敏感性,SFT和RLHF进一步增强其在认知-实用性场景中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06848 2026-01-13 cs.CL 57%

Explainable Multimodal Aspect-Based Sentiment Analysis with Dependency-guided Large Language Model

可解释的多模态基于方面的情感分析与依赖引导的大语言模型

Zhongzheng Wang, Yuanhe Tian, Hongzhi Wang, Yan Song

机构 * Harbin Institute of Technology(哈尔滨工程大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于依赖引导的大语言模型的多模态情感分析方法,通过生成可解释的自然语言解释来提升情感分类的准确性。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23010 2026-01-13 cs.SE 50%

TALM: Dynamic Tree-Structured Multi-Agent Framework with Long-Term Memory for Scalable Code Generation

TALM:具有长期记忆的动态树结构多智能体框架用于可扩展的代码生成

Ming-Tung Shen, Yuh-Jzer Joung

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 TALM通过动态树结构多智能体框架结合长期记忆机制,提升复杂代码生成任务中的推理性能和令牌效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 48 篇

2601.06289 2026-01-13 cs.CL cs.LG 90%

How well can off-the-shelf LLMs elucidate molecular structures from mass spectra using chain-of-thought reasoning?

离线大语言模型如何通过链式推理解析质谱中的分子结构?

Yufeng Wang, Lu Wei, Lin Liu, Hao Xu, Haibin Ling

机构 * Stony Brook University(石溪大学) Stanford University(斯坦福大学) Harvard Medical School(哈佛医学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 本研究评估了离线大语言模型通过链式推理解析质谱数据的能力,发现其在化学准确性上存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07199 2026-01-13 cs.LG cs.AI 84%

Forward versus Backward: Comparing Reasoning Objectives in Direct Preference Optimization

正向与反向:在直接偏好优化中比较推理目标

Murtaza Nikzad, Raghuram Ramanujan

机构 * Department of Math and Computer Science(数学与计算机科学系)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文通过直接偏好优化比较正向与反向推理目标,发现正向训练提升准确性,反向训练降低误报率,两者互补提升模型推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07375 2026-01-13 cs.CL 83%

GROKE: Vision-Free Navigation Instruction Evaluation via Graph Reasoning on OpenStreetMap

GROKE: 通过OpenStreetMap上的图推理进行无视觉导航指令评估

Farzad Shami, Subhrasankha Dey, Nico Van de Weghe, Henrikki Tenkanen

机构 * Aalto University(阿alto大学) Ghent University(根特大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 GROKE提出一种基于OpenStreetMap的无视觉导航指令评估框架,通过图推理和拓扑导航提升评估精度与可扩展性。

Comments Under Review for ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07794 2026-01-13 cs.CL cs.AI 81%

Kinship Data Benchmark for Multi-hop Reasoning

多跳推理的亲属数据基准

Tianda Sun, Dimitar Kazakov

机构 * University of York(约克大学) Department of Computer Science(计算机科学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 KinshipQA通过生成文化特定的家谱数据,评估多跳推理能力,揭示模型在不同文化背景下的推理差异。

Comments 11 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07641 2026-01-13 cs.AI cs.CL cs.MA 81%

Beyond Static Tools: Test-Time Tool Evolution for Scientific Reasoning

超越静态工具:科学推理中的测试时工具进化

Jiaxuan Lu, Ziyu Kong, Yemin Wang, Rong Fu, Haiyuan Wan, Cheng Yang, Wenjie Lou, Haoran Sun, Lilong Wang, Yankai Jiang, Xiaosong Wang, Xiao Sun, Dongzhan Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Xiamen University(厦门大学) University of Macau(澳门大学) Tsinghua University(清华大学) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出TTE框架,通过在推理过程中动态合成和进化工具,提升科学推理任务的准确性和工具效率,同时支持跨领域适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07226 2026-01-13 cs.AI cs.CL 81%

Lost in the Noise: How Reasoning Models Fail with Contextual Distractors

陷入噪声中:推理模型在上下文干扰中的失败

Seongyun Lee, Yongrae Jo, Minju Seo, Moontae Lee, Minjoon Seo

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出RARE方法,通过激励识别噪声中的有用信息,提升模型在上下文干扰下的鲁棒性,揭示增加计算量反而导致噪声环境下性能下降的反比例趋势。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06282 2026-01-13 cs.CL cs.AI 81%

Amory: Building Coherent Narrative-Driven Agent Memory through Agentic Reasoning

Amory:通过代理推理构建连贯的叙事驱动代理记忆

Yue Zhou, Xiaobo Guo, Belhassen Bayar, Srinivasan H. Sengamedu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Amazon(亚马逊)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 Amory通过增强代理推理构建连贯的叙事驱动记忆,提升长期对话代理的推理性能与响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11618 2026-01-13 cs.AI cs.LG eess.SP 81%

Benchmarking Spatiotemporal Reasoning in LLMs and Reasoning Models: Capabilities and Challenges

在大语言模型和推理模型中评估时空推理:能力和挑战

Pengrui Quan, Brian Wang, Kang Yang, Liying Han, Mani Srivastava

机构 * Department of Electrical and Computer Engineering, UCLA(电气与计算机工程系,加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出STARK基准测试,评估大语言模型和推理模型在时空推理任务中的能力和挑战,发现推理模型在复杂任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07790 2026-01-13 cs.AI 79%

Benchmarking Small Language Models and Small Reasoning Language Models on System Log Severity Classification

在系统日志严重性分类上评估小型语言模型和小型推理语言模型

Yahya Masri, Emily Ma, Zifu Wang, Joseph Rogers, Chaowei Yang

机构 * George Mason University(乔治·马歇尔大学) Harvard University(哈佛大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究评估了小型语言模型和小型推理语言模型在系统日志严重性分类上的性能,发现架构设计、训练目标和上下文整合能力共同影响模型表现。

Comments 28 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07342 2026-01-13 cs.AI 79%

Agentic Diagnostic Reasoning over Telecom and Datacenter Infrastructure

基于电信和数据中心基础设施的代理诊断推理

Nicolas Tacheny

机构 * Ni2 Innovation Lab(Ni2创新实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于代理的诊断框架,利用LLM通过MCP协议自主导航基础设施模型,实现故障诊断与影响发现,为自主事件解决和风险预测提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07232 2026-01-13 cs.AI 79%

Yes FLoReNce, I Will Do Better Next Time! Agentic Feedback Reasoning for Humorous Meme Detection

是的,Florne,我下次会做得更好!用于幽默表情包检测的代理反馈推理

Olivia Shanhong Liu, Pai Chet Ng, De Wen Soh, Konstantinos N. Plataniotis

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Florne通过闭环反馈机制提升表情包幽默检测的适应性和解释质量。

Comments LaMAS@AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08344 2026-01-13 cs.AI 79%

What Breaks Knowledge Graph based RAG? Benchmarking and Empirical Insights into Reasoning under Incomplete Knowledge

什么破坏了基于知识图谱的RAG?对在不完整知识下推理的基准测试和经验洞察

Dongzhuoran Zhou, Yuqicheng Zhu, Xiaxia Wang, Hongkuan Zhou, Yuan He, Jiaoyan Chen, Steffen Staab, Evgeny Kharlamov

机构 * University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) Amazon(亚马逊公司) University of Oxford(牛津大学) The University of Manchester(曼彻斯特大学) University of Southampton(南安普顿大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出BRINK基准测试,揭示了当前KG-RAG方法在知识不完整时推理能力有限,依赖内部记忆且泛化能力各异。

Comments Accepted as a main conference paper at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏