arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-27 至 2026-01-27 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 34 篇

2601.18137 2026-01-27 cs.AI cs.CL 84%

DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints

DeepPlanning: 用可验证约束基准测试长周期代理规划

Yinger Zhang, Shutong Jiang, Renhao Li, Jianhong Tu, Yang Su, Lianghao Deng, Xudong Guo, Chenxu Lv, Junyang Lin

机构 * Alibaba Group(阿里巴巴集团)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DeepPlanning是一个针对长周期代理规划的基准测试,通过多日旅行和多产品购物任务,评估代理在全局约束优化和局部约束推理中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18619 2026-01-27 cs.AI 83%

Visual Attention Reasoning via Hierarchical Search and Self-Verification

通过分层搜索与自验证的视觉注意力推理

Wei Cai, Jian Zhao, Yuchen Yuan, Tianle Zhang, Ming Zhu, Haichuan Tang, Xuelong Li

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出通过分层搜索与自验证的视觉注意力推理框架,有效提升多模态大语言模型的视觉定位和推理能力,显著降低幻觉发生率。

Comments The paper is withdrawn by the authors after discovering a flaw in the theoretical derivation presented in the Method section. This incorrect step leads to conclusions that are not supported by the corrected derivation. The authors plan to reconstruct the argument and will release an updated version once the issue is fully resolved

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24330 2026-01-27 cs.CV 82%

SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning

SenseNova-MARS: 通过强化学习赋能多模态代理推理与搜索

Yong Xien Chng, Tao Hu, Wenwen Tong, Xueheng Li, Jiandong Chen, Haojia Yu, Jiefan Lu, Hewei Guo, Hanming Deng, Chengjun Xie, Gao Huang, Dahua Lin, Lewei Lu

机构 * SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 SenseNova-MARS通过强化学习赋能多模态代理推理与搜索,提升视觉-语言模型在复杂视觉任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18771 2026-01-27 cs.CL cs.AI cs.IR 81%

Dep-Search: Learning Dependency-Aware Reasoning Traces with Persistent Memory

Dep-Search: 基于持久记忆的学习依赖意识推理轨迹

Yanming Liu, Xinyue Peng, Zixuan Yan, Yanxin Shen, Wenjie Xu, Yuefeng Huang, Xinyi Wang, Jiannan Cao, Jianwei Yin, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Intel Corporation(英特尔公司) Tsinghua University(清华大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 Dep-Search 通过 GRPO 集成结构化推理、检索和持久记忆,提升 LLM 处理复杂多跳推理任务的能力。

Comments Dep-Search 1st version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04472 2026-01-27 cs.CL cs.AI 81%

RECAP: REwriting Conversations for Intent Understanding in Agentic Planning

RECAP:用于代理规划中意图理解的对话重写

Kushan Mitra, Dan Zhang, Hannah Kim, Estevam Hruschka

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 RECAP通过对话重写提升代理规划中的意图理解,提出新基准和方法,验证重写对规划效用的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17346 2026-01-27 cs.AI 79%

Multi-Agent Learning Path Planning via LLMs

通过大型语言模型进行多智能体学习路径规划

Haoxin Xu, Changyong Qi, Tong Liu, Bohao Zhang, Anna He, Bingqian Jiang, Longwei Zheng, Xiaoqing Gu

机构 * Shanghai International Studies University(上海国际 Studies 大学) East China Normal University(华东师范大学) Huaiyin Normal University(淮阴师范学院) City University of Macau(澳门城市大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本研究提出基于LLMs的多智能体学习路径规划框架,通过角色与规则协作机制提升学习路径的透明性与可解释性,实验表明其在路径质量、知识一致性及认知负荷匹配方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11056 2026-01-27 cs.IR cs.AI 79%

From Reasoning LLMs to BERT: A Two-Stage Distillation Framework for Search Relevance

从推理LLM到BERT:一种两阶段蒸馏框架用于搜索相关性

Runze Xia, Yupeng Ji, Yuxi Zhou, Haodong Liu, Teng Zhang, Piji Li

机构 * Researcher(研究者)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种两阶段蒸馏框架,通过领域适应教师模型和对比推理自蒸馏方法,提升搜索相关性预测的效率和效果。

Comments TheWebConf 2026 Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17743 2026-01-27 cs.CV 78%

VideoPro: Adaptive Program Reasoning for Long Video Understanding

VideoPro: 针对长视频理解的自适应程序推理

Chenglin Li, Feng Han, Yikun Wang, Ruilin Li, Shuai Dong, Haowen Hou, Haitao Li, Qianglong Chen, Feng Tao, Jingqi Tong, Yin Zhang, Jiaqi Wang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 VideoPro通过自适应程序推理框架提升长视频理解的效率和可靠性,利用快慢推理机制和参数优化在视觉任务中取得更高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17227 2026-01-27 cs.RO 78%

Hierarchical Informative Path Planning via Graph Guidance and Trajectory Optimization

基于图引导和轨迹优化的分层信息路径规划

Avraiem Iskandar, Shamak Dutta, Kevin Murrant, Yash Vardhan Pant, Stephen L. Smith

机构 * Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系) National Research Council Canada(加拿大国家研究理事会)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出一种分层信息路径规划方法,结合图引导和轨迹优化,通过分段预算分配和样条细化,实现更低的后验不确定性与更快的运行速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11271 2026-01-27 physics.med-ph 78%

An AI dose engine for fast carbon ion treatment planning

一种用于快速碳离子治疗计划的AI剂量引擎

Anastasiia Quarz, Angelica De Gregorio, Gaia Franciosini, Angelo Schiavi, Zoltán Perkó, Lennart Volz, Christoph Hoog Antink, Vincenzo Patera, Marco Durante, Christian Graeff

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出了一种基于AI的快速碳离子治疗剂量引擎,实现与MC模拟相当的精度,速度提升达400倍,支持在线自适应规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18207 2026-01-27 cs.LG cs.AI cs.CL cs.IR 75%

PaperSearchQA: Learning to Search and Reason over Scientific Papers with RLVR

PaperSearchQA: 基于强化学习与验证奖励的学习科学论文搜索与推理

James Burgess, Jan N. Hansen, Duo Peng, Yuhui Zhang, Alejandro Lozano, Min Woo Sun, Emma Lundberg, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) Chan Zuckerberg Biohub Network(查纳·泽克拜尔生物枢纽网络) KTH Royal Institute of Technology(皇家理工学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PaperSearchQA通过训练搜索代理在科学论文中进行搜索与推理,提升技术问答能力,为未来的人工智能科学家系统奠定基础。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16984 2026-01-27 cs.LG cs.AI cs.CL cs.CV cs.IR cs.MM 75%

TelcoAI: Advancing 3GPP Technical Specification Search through Agentic Multi-Modal Retrieval-Augmented Generation

TelcoAI: 通过代理多模态检索增强生成技术推进3GPP技术规范搜索

Rahul Ghosh, Chun-Hao Liu, Gaurav Rele, Vidya Sagar Ravipati, Hazar Aouad

机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(生成式AI创新中心,亚马逊网络服务)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TelcoAI通过代理多模态检索增强生成技术,提升3GPP技术规范搜索的准确性和效率,实现87%的召回率和16%的性能提升。

Comments Accepted to IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17383 2026-01-27 cs.CV cs.AI 70%

Physical Prompt Injection Attacks on Large Vision-Language Models

针对大视觉-语言模型的物理提示注入攻击

Chen Ling, Kai Hu, Hangcheng Liu, Xingshuo Han, Tianwei Zhang, Changhai Ou

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出了一种无需访问模型或输入的物理提示注入攻击方法,通过物理物体注入恶意指令,成功攻击多种大视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17219 2026-01-27 cs.RO 67%

Advancing Improvisation in Human-Robot Construction Collaboration: Taxonomy and Research Roadmap

推动人机协同建造中的即兴能力:分类与研究路线图

David Wireko Atibila, Vineet R. Kamat, Carol C. Menassa

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出六级分类法,分析人机协同建造中即兴能力的发展现状与未来研究方向,指出技术、概念和方法学三方面障碍,建议通过增强现实、大语言模型和云系统提升人机协作水平。

Comments 73 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14506 2026-01-27 cs.RO 67%

InteLiPlan: An Interactive Lightweight LLM-Based Planner for Domestic Robot Autonomy

InteLiPlan:一种交互式轻量级基于大语言模型的规划器,用于家用机器人自主性

Kim Tien Ly, Kai Lu, Ioannis Havoutis

机构 * Middlesex University(中塞克斯大学) Oxford Robotics Institute, University of Oxford(牛津机器人研究所,牛津大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 InteLiPlan是一种基于大语言模型的轻量级交互式规划器,通过实时机载计算实现家用机器人自主性和鲁棒性的提升,成功完成95%的任务执行率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18552 2026-01-27 cs.CL cs.LG 62%

Unknown Unknowns: Why Hidden Intentions in LLMs Evade Detection

未知未知数:为何大语言模型中的隐藏意图难以被检测

Devansh Srivastav, David Pape, Lea Schönherr

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示大语言模型中隐藏意图难以检测的问题,提出分类法并分析检测方法失效原因,强调需建立稳健框架以应对潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18217 2026-01-27 cs.AI cs.LG 62%

Paying Less Generalization Tax: A Cross-Domain Generalization Study of RL Training for LLM Agents

支付更少的泛化税:RL训练对LLM代理跨域泛化能力的研究

Zhihan Liu, Lin Guan, Yixin Nie, Kai Zhang, Zhuoqun Hao, Lin Chen, Asli Celikyilmaz, Zhaoran Wang, Na Zhang

机构 * Meta Superintelligence Labs(Meta超智能实验室) FAIR at Meta(Meta的FAIR) Northwestern University(西北大学) The Ohio State University(俄亥俄州立大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究探讨了RL训练对LLM代理跨域泛化能力的影响,发现增加状态信息丰富度可提升泛化性能,同时指出建模选择对泛化能力的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06913 2026-01-27 cs.LG cs.AI cs.RO 62%

DecompGAIL: Learning Realistic Traffic Behaviors with Decomposed Multi-Agent Generative Adversarial Imitation Learning

DecompGAIL: 通过分解多智能体生成对抗模仿学习学习真实交通行为

Ke Guo, Haochen Liu, Xiaojun Wu, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Desay SV Automotive(德赛西威汽车)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 DecompGAIL通过分解多智能体生成对抗模仿学习方法,解决多智能体设置中GAIL的不稳定性问题,提升交通行为的真实性和整体性能。

Comments accepted by ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14278 2026-01-27 cs.CR cs.AI cs.LG 62%

Beyond Data Privacy: New Privacy Risks for Large Language Models

超越数据隐私:大型语言模型的新隐私风险

Yuntao Du, Zitao Li, Ninghui Li, Bolin Ding

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学) Alibaba(阿里巴巴)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了大型语言模型在部署过程中出现的新隐私风险,并提出缓解策略以应对日益强大的LLMs带来的威胁。

Comments Published in the IEEE Data Engineering Bulletin: http://sites.computer.org/debull/A25dec/issue1.htm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15333 2026-01-27 cs.LG cs.AI q-bio.QM 62%

Empowering LLMs for Structure-Based Drug Design via Exploration-Augmented Latent Inference

通过探索增强的潜在推理增强LLM用于基于结构的药物设计

Xuanning Hu, Anchen Li, Qianli Xing, Jinglong Ji, Hao Tuo, Bo Yang

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University(教育部符号计算与知识工程重点实验室) Department of Computer Science, Aalto University(艾尔沃斯大学计算机科学系) College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ELILLM通过探索增强的潜在推理框架,提升LLM在基于结构的药物设计中的表现,实现更有效的分子生成和结合亲和力预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18620 2026-01-27 cs.LG 57%

CASSANDRA: Programmatic and Probabilistic Learning and Inference for Stochastic World Modeling

CASSANDRA:面向随机世界建模的程序化与概率学习与推理

Panagiotis Lymperopoulos, Abhiramon Rajasekharan, Ian Berlot-Attwell, Stéphane Aroca-Ouellette, Kaheer Suleman

机构 * Skyfall AI Tufts University(塔夫茨大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Toronto(多伦多大学) Vector Instiute(Vector研究所)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 CASSANDRA通过结合LLM的知识先验和概率图模型结构学习,提升随机世界建模中的转移预测与规划能力。

Comments 28 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18202 2026-01-27 cs.AI 57%

SAGE: Steerable Agentic Data Generation for Deep Search with Execution Feedback

SAGE: 用于深度搜索的可调节代理数据生成与执行反馈

Fangyuan Xu, Rujun Han, Yanfei Chen, Zifeng Wang, I-Hung Hsu, Jun Yan, Vishy Tirumalashetty, Eunsol Choi, Tomas Pfister, Chen-Yu Lee

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 SAGE通过生成高质量、难度可控的深度搜索问题-答案对,提升深度搜索代理的性能和适应性

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18067 2026-01-27 cs.AI cs.NE cs.PL 57%

EvolVE: Evolutionary Search for LLM-based Verilog Generation and Optimization

EvolVE: 基于LLM的Verilog生成与优化的进化搜索

Wei-Po Hsin, Ren-Hao Deng, Yao-Ting Hsieh, En-Ming Huang, Shih-Hao Hung

机构 * Department of Electrical Engineering(电气工程系) National Taiwan University(国立台湾大学) Department of Computer Science and Information Engineering(计算机科学与信息工程系) Institute of Information Science(信息科学研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 EvolVE通过进化搜索方法提升LLM在Verilog生成与优化中的性能,达到98.1%的准确率并优化行业级集成电路设计。

Comments 17 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17920 2026-01-27 cs.AI 57%

Agentic AI for Self-Driving Laboratories in Soft Matter: Taxonomy, Benchmarks,and Open Challenges

代理AI在软物质中的自主实验室:分类、基准和开放挑战

Xuanzhou Chen, Audrey Wang, Stanley Yin, Hanyang Jiang, Dong Zhang

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文探讨了自主实验室在软物质中的应用,提出了基于智能体的环境交互框架,回顾了闭环实验的主要方法,并指出了多模态表示、校准不确定性、安全探索和共享基准基础设施等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17744 2026-01-27 cs.AI cs.CR cs.DC 57%

Faramesh: A Protocol-Agnostic Execution Control Plane for Autonomous Agent Systems

Faramesh:一种协议无关的自主代理系统执行控制平面

Amjad Fatmi

机构 * The Faramesh Labs(弗拉梅什实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Faramesh通过非可绕过的动作授权边界,实现自主代理系统执行时的强制授权和可预测治理。

Comments 40 pages, 10 figures. Preprint. Code: https://github.com/faramesh/faramesh-core

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17567 2026-01-27 cs.IR cs.AI 57%

Real-Time Trend Prediction via Continually-Aligned LLM Query Generation

通过持续对齐的LLM查询生成进行实时趋势预测

Zijing Hui, Wenhan Lyu, Shusen Wang, Li Chen, Chu Wang

机构 * Meta Platforms(Meta平台)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 RTTP通过持续对齐的LLM查询生成,在低流量搜索环境中实现实时趋势预测,显著提升尾部趋势检测精度和查询生成准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17168 2026-01-27 cs.AI cs.MA 57%

Interpreting Agentic Systems: Beyond Model Explanations to System-Level Accountability

解释代理系统:超越模型解释到系统级问责

Judy Zhu, Dhari Gandhi, Himanshu Joshi, Ahmad Rezaie Mianroodi, Sedef Akinli Kocak, Dhanesh Ramachandran

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) University of Texas, Austin(德克萨斯大学奥斯汀分校) Dalhousie University(达尔豪斯大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文探讨了代理系统中可解释性技术的必要性,提出需设计专门方法以确保系统在目标形成、环境交互和结果评估等阶段的可追溯性和问责性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05171 2026-01-27 cs.CL 57%

Inside Out: Evolving User-Centric Core Memory Trees for Long-Term Personalized Dialogue Systems

Inside Out: 为长期个性化对话系统演化用户导向的核心内存树

Jihao Zhao, Ding Chen, Zhaoxin Fan, Kerun Xu, Mengting Hu, Bo Tang, Feiyu Xiong, Zhiyu Li

机构 * School of Information, Renmin University of China(中国人民大学信息学院) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) China Telecom Research Institute(中国电信研究院) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Nankai University(南开大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 Inside Out通过演化用户导向的核心内存树,提升长期个性化对话系统的内存压缩与身份一致性,采用轻量级MemListener实现动态更新与高效响应生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17002 2026-01-27 cs.CL 57%

RAM-SD: Retrieval-Augmented Multi-agent framework for Sarcasm Detection

RAM-SD:基于检索的多智能体框架用于讽刺检测

Ziyang Zhou, Ziqi Liu, Yan Wang, Yiming Lin, Yangbin Chen

机构 * Xi’an Jiaotong–Liverpool University(西安交通大学利物浦大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 RAM-SD通过多智能体框架提升讽刺检测性能,实现77.74%的宏F1值,提供透明推理轨迹。

Comments 12 pages, 4 figures, 6 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14197 2026-01-27 econ.GN q-fin.EC 50%

Location-Robust Cost-Preserving Blended Pricing for Multi-Campus AI Data Centers

具有位置鲁棒性的成本保持混合定价:多校区人工智能数据中心

Qi He

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种具有位置鲁棒性的成本保持混合定价方法,通过两个操作符解决异质位置混合导致的SKU排名反转问题,并在AI数据中心中实现了有效的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏