arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-09 至 2026-01-09 共收录 100 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 18 篇

2601.04703 2026-01-09 cs.AI 57%

Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search

超越单一架构:一种多智能体搜索与知识优化框架用于智能搜索

Yiqun Chen, Lingyong Yan, Zixuan Yang, Erhan Zhang, Jiashu Zhao, Shuaiqiang Wang, Dawei Yin, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) Baidu Inc.(百度公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 M-ASK提出了一种多智能体框架,通过分解智能搜索为搜索行为和知识管理两个角色,提升搜索效率与稳定性,实现更优的答案准确性和训练动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04516 2026-01-09 cs.CL 57%

LinguaGame: A Linguistically Grounded Game-Theoretic Paradigm for Multi-Agent Dialogue Generation

LinguaGame: 一种基于语言的多智能体对话生成博弈论范式

Yuxiao Ye, Yiming Zhang, Yiran Ma, Huiyuan Xie, Huining Zhu, Zhiyuan Liu

机构 * Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学) East China University of Political Science and Law(中国政法大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 LinguaGame通过博弈论范式提升多智能体对话生成的通信效率,利用语言感知推理实现意图和策略的高效沟通。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04500 2026-01-09 cs.AI 57%

GUITester: Enabling GUI Agents for Exploratory Defect Discovery

GUITester: 使GUI代理用于探索性缺陷发现

Yifei Gao, Jiang Wu, Xiaoyi Chen, Yifan Yang, Zhe Cui, Tianyi Ma, Jiaming Zhang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Hithink Research(慧思科技) Nanyang Technological University(南洋理工大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 GUITester通过解耦导航与验证的多代理框架,有效解决了探索性GUI测试中目标导向遮蔽和执行偏差归因的问题,实现了48.90%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04327 2026-01-09 cs.DC cs.AI 57%

ParaCodex: A Profiling-Guided Autonomous Coding Agent for Reliable Parallel Code Generation and Translation

ParaCodex: 一种基于性能分析的自主编码代理,用于可靠并行代码生成与翻译

Erel Kaplan, Tomer Bitan, Lian Ghrayeb, Le Chen, Tom Yotam, Niranjan Hasabnis, Gal Oren

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 ParaCodex是一种基于性能分析的自主编码代理,通过分阶段热点分析、显式数据规划和正确性门控,实现高效并行代码生成与翻译,显著提升GPU性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03135 2026-01-09 cs.AI 57%

Beyond Retrieval: Improving Evidence Quality for LLM-based Multimodal Fact-Checking

超越检索:提升基于大语言模型的多模态事实核查的证据质量

Haoran Ou, Gelei Deng, Xingshuo Han, Jie Zhang, Han Qiu, Shangwei Guo, Tianwei Zhang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Aletheia框架,通过改进证据检索策略提升多模态事实核查的证据质量,实验证明其在虚假信息检测中的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24385 2026-01-09 cs.CV cs.RO 50%

Forging Spatial Intelligence: A Roadmap of Multi-Modal Data Pre-Training for Autonomous Systems

锻造空间智能:面向自主系统多模态数据预训练的路线图

Song Wang, Lingdong Kong, Xiaolu Liu, Hao Shi, Wentong Li, Jianke Zhu, Steven C. H. Hoi

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Alibaba Group(阿里巴巴集团) Singapore Management University(新加坡管理学院)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出多模态数据预训练框架,旨在通过整合多传感器数据提升自主系统空间智能,解决单模态模型整合难题,并提出统一的预训练范式分类及未来发展方向。

Comments Survey; 40 pages, 7 figures, 9 tables; GitHub Repo at https://github.com/worldbench/awesome-spatial-intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 5 篇

2510.22836 2026-01-09 cs.AI 79%

Rethinking the Text-Vision Reasoning Imbalance in MLLMs through the Lens of Training Recipes

通过训练食谱的视角重新思考MLLMs中的文本-视觉推理不平衡

Guanyu Yao, Qiucheng Wu, Yang Zhang, Zhaowen Wang, Handong Zhao, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室) Adobe Research(Adobe研究院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过分析训练食谱,提出减少多模态大语言模型中文本与视觉推理不平衡的方法,旨在提升视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04778 2026-01-09 cs.CV cs.AI cs.CL cs.MM 62%

CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models

CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉

Tobia Poppi, Burak Uzkent, Amanmeet Garg, Lucas Porto, Garin Kessler, Yezhou Yang, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara, Florian Schiffers

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(帕尔马大学) Amazon Prime Video(亚马逊Prime视频)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04819 2026-01-09 cs.AI 57%

AECV-Bench: Benchmarking Multimodal Models on Architectural and Engineering Drawings Understanding

AECV-Bench:在建筑和工程图纸理解上的多模态模型评估基准

Aleksei Kondratenko, Mussie Birhane, Houssame E. Hsain, Guido Maciocci

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 AECV-Bench评估多模态模型在建筑图纸理解上的能力,发现OCR和文本问答表现最佳,但符号理解尤其是门窗计数仍存在较大误差,需改进领域特定表示和人机协作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04734 2026-01-09 cs.CV 50%

AIVD: Adaptive Edge-Cloud Collaboration for Accurate and Efficient Industrial Visual Detection

AIVD:自适应边缘-云协作用于准确高效的工业视觉检测

Yunqing Hu, Zheming Yang, Chang Zhao, Qi Guo, Meng Gao, Pengcheng Li, Wen Ji

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 AIVD通过边缘-云协作提升工业视觉检测的精度与效率,采用轻量边缘检测与云MLLM协同,结合高效微调策略和动态调度算法,实现高吞吐低延迟的资源优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18951 2026-01-09 cs.CV 50%

TopoBDA: Towards Bezier Deformable Attention for Road Topology Understanding

TopoBDA: 向贝塞尔可变形注意力迈进:道路拓扑理解

Muhammet Esat Kalfaoglu, Halil Ibrahim Ozturk, Ozsel Kilinc, Alptekin Temizel

机构 * Graduate School of Informatics, Middle East Technical University(信息学院,中东部技术大学) Togg/Trutek AI Team(Togg/Trutek人工智能团队)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 TopoBDA通过贝塞尔可变形注意力提升道路拓扑理解,结合多模态数据增强性能。

Comments Project page: https://artest08.github.io/TopoBDA.github.io/

Journal ref Neurocomputing, Vol. 670, 132360 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 4 篇

2601.04973 2026-01-09 cs.AI cs.CL 90%

ConMax: Confidence-Maximizing Compression for Efficient Chain-of-Thought Reasoning

ConMax:用于高效思维链推理的置信度最大化压缩

Minda Hu, Zexuan Qiu, Zenan Xu, Kun Li, Bo Zhou, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) LLM Department, Tencent(腾讯机器学习部门)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 ConMax通过强化学习框架在保持推理模式的同时,高效压缩推理轨迹,提升大规模推理模型的效率与性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04254 2026-01-09 cs.AI cs.LG 81%

Scaling Trends for Multi-Hop Contextual Reasoning in Mid-Scale Language Models

中等规模语言模型中多跳上下文推理的扩展趋势

Brady Steele, Micah Katz

机构 * Georgia Institute of Technology(佐治亚理工学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过对比不同模型的多跳推理能力,发现多代理系统在推理任务中表现优于规则方法,且模型基础能力影响放大效果。

Comments 18 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04411 2026-01-09 cs.LG cs.AI cs.CL 75%

Rate or Fate? RLV$^\varepsilon$R: Reinforcement Learning with Verifiable Noisy Rewards

速率还是命运?RLV$^\varepsilon$R:具有可验证噪声奖励的强化学习

Ali Rad, Khashayar Filom, Darioush Keivan, Peyman Mohajerin Esfahani, Ehsan Kamalinejad

机构 * Cognichip AI University of Toronto(多伦多大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLV$^\varepsilon$R框架,通过分析验证噪声对强化学习的影响,揭示了噪声如何影响学习速率与命运,并通过实验验证了在不同Youden指数下动态变化的相变特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04674 2026-01-09 cs.IR 50%

PROMISE: Process Reward Models Unlock Test-Time Scaling Laws in Generative Recommendations

PROMISE: 过程奖励模型解锁生成推荐的测试时扩展定律

Chengcheng Guo, Kuo Cai, Yu Zhou, Qiang Luo, Ruiming Tang, Han Li, Kun Gai, Guorui Zhou

专题命中 测试时计算 :reasoning(abstract)

AI总结 PROMISE通过整合密集逐步验证和PRM引导的束搜索策略,解决生成推荐中的语义漂移问题,提升推荐准确性并实现高效部署。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 17 篇

2505.22662 2026-01-09 cs.CL cs.LG 86%

AutoL2S: Auto Long-Short Reasoning for Efficient Large Language Models

AutoL2S: 自动长短期推理用于高效大语言模型

Feng Luo, Yu-Neng Chuang, Guanchu Wang, Hoang Anh Duy Le, Shaochen Zhong, Hongyi Liu, Jiayi Yuan, Yang Sui, Vladimir Braverman, Vipin Chaudhary, Xia Hu

机构 * Rice University(里士大学) University of North Carolina at Charlotte(北卡罗来纳州立大学) John Hopkins University(约翰·霍普金斯大学) Case Western Reserve University(凯斯西储大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 AutoL2S通过动态调整推理长度,提升大语言模型的推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03263 2026-01-09 cs.CL cs.AI 84%

Internal Reasoning vs. External Control: A Thermodynamic Analysis of Sycophancy in Large Language Models

内部推理 vs. 外部控制:大型语言模型中谄媚现象的热力学分析

Edward Y. Chang

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出受控因果锚定(RCA)方法,通过评估推理过程而非结果,有效检测大型语言模型中的谄媚现象,无需真实数据且打破自我强化偏见循环。

Comments 20 pages, 1 figure, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04853 2026-01-09 cs.CL 83%

RAAR: Retrieval Augmented Agentic Reasoning for Cross-Domain Misinformation Detection

RAAR:跨领域虚假信息检测的检索增强代理推理

Zhiwei Liu, Runteng Guo, Baojie Qu, Yuechen Jiang, Min Peng, Qianqian Xie, Sophia Ananiadou

机构 * The University of Manchester(曼彻斯特大学) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Center for Language and Information Research, Wuhan University(武汉大学语言与信息研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 RAAR通过多代理协作和检索增强推理,提升跨领域虚假信息检测的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05167 2026-01-09 cs.CL cs.AI cs.LG 82%

RelayLLM: Efficient Reasoning via Collaborative Decoding

RelayLLM: 通过协作解码实现高效推理

Chengsong Huang, Tong Zheng, Langlin Huang, Jinyuan Li, Haolin Liu, Jiaxin Huang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Maryland(马里兰大学) University of Virginia(弗吉尼亚大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RelayLLM通过令牌级协作解码实现高效推理,利用SLM作为主动控制器,仅在必要时调用LLM,显著降低计算成本并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05111 2026-01-09 cs.CL cs.AI 73%

Agent-as-a-Judge

代理作为裁判

Runyang You, Hongru Cai, Caiqi Zhang, Qiancheng Xu, Meng Liu, Tiezheng Yu, Yongqi Li, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Cambridge(剑桥大学) Shandong Jianzhu University(山东建筑大学) Huawei Technologies(华为技术)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于代理的评估框架,通过规划、工具验证和多代理协作提升评估的鲁棒性和可验证性,并提供了该领域的发展分类和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24556 2026-01-09 cs.CL cs.AI cs.CY 62%

Safe in the Future, Dangerous in the Past: Dissecting Temporal and Linguistic Vulnerabilities in LLMs

未来安全,过去危险:剖析大语言模型中的时间与语言脆弱性

Muhammad Abdullahi Said, Muhammad Sammani Sani

机构 * African Institute for Mathematical Science(非洲数学科学研究所) University of Vienna(维也纳大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在不同语言和时间框架下存在显著安全差异,提出不变对齐以提升跨语言和时间的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04688 2026-01-09 cs.CL cs.AI cs.FL 62%

ToolGate: Contract-Grounded and Verified Tool Execution for LLMs

ToolGate: 以合同为基础并经过验证的工具执行用于LLMs

Yanming Liu, Xinyue Peng, Jiannan Cao, Xinyi Wang, Songhang Deng, Jintao Chen, Jianwei Yin, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Southeast University(东南大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ToolGate通过形式化合同和验证机制,确保LLM调用工具时逻辑安全和状态演变的可验证性,提升系统可靠性与可调试性。

Comments First version of ToolGate

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04526 2026-01-09 cs.SE cs.AI cs.CL 62%

Advancing Language Models for Code-related Tasks

推动与代码相关的语言模型

Zhao Tian

机构 * School of Computer Software, Tianjin University(天津大学软件学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过改进代码数据质量、模型架构和推理能力,推动语言模型在软件开发中的实际应用。

Comments Accepted by ICSE 2026 (DS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04210 2026-01-09 cs.CL cs.AI cs.IT math.IT 62%

Complexity Agnostic Recursive Decomposition of Thoughts

无复杂度偏见的思维递归分解

Kaleem Ullah Qasim, Jiashu Zhang, Hafiz Saif Ur Rehman

机构 * Southwest Jiaotong University(西南交通大学) Southwestern University of Finance and Economics(西南财经大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CARD通过预估问题复杂度并递归分解提升多步推理的准确性和效率

Comments 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05187 2026-01-09 cs.AI 57%

SimuAgent: An LLM-Based Simulink Modeling Assistant Enhanced with Reinforcement Learning

SimuAgent: 一种基于LLM的Simulink建模助手,结合强化学习增强

Yanchang Liang, Xiaowei Zhao

机构 * School of Engineering, University of Warwick(战争学院) Intelligent Control and Smart Energy (ICSE) Research Group(智能控制与智能能源研究组)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 SimuAgent结合强化学习和LLM,提升Simulink建模效率与准确性,实现快速收敛和高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05159 2026-01-09 cs.CV cs.AI 57%

Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering

视觉-语言反思:通过可解释的双因果引导减轻大语言模型中的过度自信幻觉

Shuliang Liu, Songbo Yang, Dong Fang, Sihang Jia, Yuqi Tang, Lingfeng Su, Ruoshui Peng, Yibo Yan, Xin Zou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) The Hong Kong University of Science and Technology(香港理工大学) LIGHTSPEED

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 VLI通过可解释的双因果引导方法,有效减少大语言模型中的对象幻觉,提升多模态任务的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04945 2026-01-09 cs.AI 57%

T-Retriever: Tree-based Hierarchical Retrieval Augmented Generation for Textual Graphs

T-Retriever:基于树的分层检索增强生成用于文本图谱

Chunyu Wei, Huaiyu Qin, Siyuan He, Yunhai Wang, Yueguo Chen

机构 * BRAIN of RUC(北京理工大学脑科学研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 T-Retriever通过语义和结构引导的树状检索方法,改进了图谱检索增强生成,提升复杂查询的连贯性和语境相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04859 2026-01-09 cs.CL 57%

A Navigational Approach for Comprehensive RAG via Traversal over Proposition Graphs

一种通过命题图遍历实现全面RAG的导航方法

Maxime Delmas, Lei Xu, André Freitas

机构 * Idiap Research Institute(日内瓦研究所) École Polytechnique Fédérale de Lausanne(联邦理工学院洛桑分校) University of Manchester(曼彻斯特大学) CRUK Manchester Institute(CRUK曼彻斯特研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 ToPG通过命题图遍历实现高效结构RAG系统,结合查询意识的图遍历与事实细粒度,提升复杂多跳查询和单跳事实检索的性能。

Comments 23 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10509 2026-01-09 cs.LG 57%

From Actions to Words: Towards Abstractive-Textual Policy Summarization in RL

从动作到词语:迈向强化学习中基于抽象文本的策略摘要

Sahar Admoni, Assaf Hallak, Yftah Ziser, Omer Ben-Porat, Ofra Amir

机构 * Nvidia Research(英伟达研究)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 SySLLM通过将策略解释转化为语言生成问题,利用大型语言模型生成连贯的摘要,以解释复杂强化学习行为。

Comments In Proceedings of AAMAS 2026 (The 25th International Conference on Autonomous Agents and Multi-Agent Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04766 2026-01-09 cs.CL 57%

Revisiting Judge Decoding from First Principles via Training-Free Distributional Divergence

从第一原理重新审视裁判解码:通过无训练分布分歧方法

Shengyin Sun, Yiming Li, Renxi Liu, Weizhe Lin, Hui-Ling Zhen, Xianzhi Yu, Mingxuan Yuan, Chen Ma

机构 * City University of Hong Kong(香港城市大学) Huawei Technologies(华为技术有限公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出一种基于KL散度的无训练裁判解码方法,通过理论证明与实验验证,展示了其在提升推理和编码任务性能上的优势。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏