arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11104 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11104 篇

2601.11560 2026-01-21 cs.IR cs.AI cs.LG 62%

DeepEvidence: Empowering Biomedical Discovery with Deep Knowledge Graph Research

DeepEvidence: 通过深度知识图谱研究赋能生物医学发现

Zifeng Wang, Zheng Chen, Ziwei Yang, Xuan Wang, Qiao Jin, Yifan Peng, Zhiyong Lu, Jimeng Sun

机构 * Keiji AI Institute of Scientific and Industrial Research, Osaka University(大阪大学科学工业研究所) Bioinformatics Center, Institute for Chemical Research, Kyoto University(京都大学化学研究所生物信息中心) Division of Intramural Research, National Library of Medicine, National Institutes of Health(国家卫生研究院生物医学图书馆内部研究部) Department of Population Health Sciences, Weill Cornell Medicine(韦尔·科恩医学中心流行病学与健康科学系) School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机与数据科学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DeepEvidence通过深度知识图谱研究框架,系统化地连接异构生物医学资源,提升科学发现的效率和证据综合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09105 2026-01-19 cs.AI cs.CL cs.CV 62%

AviationLMM: A Large Multimodal Foundation Model for Civil Aviation

AviationLMM:民用航空的大规模多模态基础模型

Wenbin Li, Jingling Wu, Xiaoyong Lin. Jing Chen, Cong Chen

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AviationLMM旨在通过统一民用航空的异构数据流,提升航空安全与效率,推动可信且隐私保护的航空人工智能生态系统发展。

Comments Accepted by 2025 7th International Conference on Interdisciplinary Computer Science and Engineering (ICICSE 2025), Chongqing, China; 9 pages,1 figure,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03687 2026-01-19 cs.CL cs.AI 62%

MedReflect: Teaching Medical LLMs to Self-Improve via Reflective Correction

MedReflect: 通过反思修正教学医疗LLM自我改进

Yue Huang, Yanyuan Chen, Dexuan Xu, Chenzhuo Zhao, Weihua Yue, Yu Huang

机构 * Peking University(北京大学) University of Virginia(弗吉尼亚大学) Peking University Sixth Hospital(北京大学第六医院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MedReflect通过自我反思机制提升医疗LLM的自主学习能力,减少外部数据依赖,实现高效医疗问题解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11788 2026-01-16 cs.CL cs.AI 62%

WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms

WebRollback: 通过显式回滚机制增强网络代理

Zhisong Zhang, Tianqing Fang, Kaixin Ma, Wenhao Yu, Hongming Zhang, Haitao Mi, Dong Yu

机构 * City University of Hong Kong(香港城市大学) Tencent AI Lab(腾讯人工智能实验室)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 通过显式回滚机制提升网络代理的导航效率与灵活性

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13257 2026-01-14 cs.AI cs.CV cs.LG 62%

Explaning with trees: interpreting CNNs using hierarchies

用树解释:用层次结构解释CNN

Caroline Mazini Rodrigues, Nicolas Boutry, Laurent Najman

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出xAiTrees框架,通过层次分割技术为CNN提供忠实且可解释的解释,提升xAI的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07767 2026-01-13 cs.LG cs.CL 62%

Are LLM Decisions Faithful to Verbal Confidence?

大型语言模型的决策是否忠实于其语言自信度?

Jiawei Wang, Yanfei Zhou, Siddartha Devic, Deqing Fu

机构 * University of Southern California(南加州大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究发现大型语言模型在高惩罚条件下缺乏战略决策能力,其语言自信度与实际决策不一致,影响AI系统的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06505 2026-01-13 cs.LG cs.AI 62%

Neural Nonmyopic Bayesian Optimization in Dynamic Cost Settings

动态成本环境下的神经非短视贝叶斯优化

Sang T. Truong, Duc Q. Nguyen, Willie Neiswanger, Ryan-Rhys Griffiths, Stefano Ermon, Nick Haber, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) University of Southern California(南加州大学) FutureHouse, Inc.(FutureHouse公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 LookaHES通过整合神经策略,实现动态成本环境下的非短视贝叶斯优化,提升复杂决策空间中的长视图优化能力。

Comments 32 pages, 20 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04566 2026-01-13 cs.AI cs.CL 62%

BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents

BackdoorAgent: 一个统一框架用于针对基于LLM的代理的后门攻击

Yunhao Feng, Yige Li, Yutao Wu, Yingshui Tan, Yanming Guo, Yifan Ding, Kun Zhai, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Singapore Management University(新加坡管理大学) Alibaba Group(阿里巴巴集团) Deakin University(德肯大学) Hunan Institute of Advanced Technology(湖南高级技术研究所)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 BackdoorAgent提出一个统一框架,分析LLM代理中后门攻击的跨阶段传播和触发器持续性,揭示代理工作流的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05376 2026-01-12 cs.AI cs.CL 62%

The Persona Paradox: Medical Personas as Behavioral Priors in Clinical Language Models

医疗人设悖论:临床语言模型中的行为先验

Tassallah Abdullahi, Shrestha Ghosh, Hamish S Fraser, Daniel León Tramontini, Adeel Abbasi, Ghada Bourjeily, Carsten Eickhoff, Ritambhara Singh

机构 * Brown University(布朗大学) University of Tuebingen(图宾根大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示医疗人设在临床语言模型中产生上下文依赖的性能权衡,显示其在重症护理任务中提升表现,但在初级护理中降低性能,且互动风格影响风险倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04767 2026-01-09 cs.AI cs.CL 62%

AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search

AT$^2$PO: 通过树搜索实现基于回合的代理策略优化

Zefang Zong, Dingwei Chen, Yang Li, Qi Yi, Bo Zhou, Chengming Li, Bo Qian, Peng Chen, Jie Jiang

机构 * Tencent Inc(腾讯公司) Sun Yat-Sen University(中山大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AT$^2$PO 通过树搜索实现多轮代理强化学习,解决探索多样性、奖励分配和策略优化不一致问题,提升性能达1.84个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02574 2026-01-07 cs.CL cs.AI 62%

Fact-Checking with Large Language Models via Probabilistic Certainty and Consistency

通过概率确定性与一致性进行大型语言模型的事实核查

Haoran Wang, Maryam Khalid, Qiong Wu, Jian Gao, Cheng Cao

机构 * Emory University(埃默里大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PCC通过概率确定性与一致性框架,自适应决定LLM是否依赖内部知识或启动检索,以提升事实核查的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22458 2026-01-06 cs.CL cs.AI 62%

Evaluating LLM-based Agents for Multi-Turn Conversations: A Survey

评估基于大语言模型的代理在多轮对话中的性能:一项调查

Shengyue Guan, Jindong Wang, Jiang Bian, Bin Zhu, Jian-guang Lou, Haoyi Xiong

机构 * Microsoft(微软)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于PRISMA框架的系统方法,用于评估多轮对话中基于LLM的代理,通过两个分类系统定义评估内容和方法,涵盖任务完成、响应质量等关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23631 2026-01-05 cs.LG cs.AI 62%

BOAD: Discovering Hierarchical Software Engineering Agents via Bandit Optimization

通过Bandit优化发现层次化软件工程代理:BOAD

Iris Xu, Guangtao Zeng, Zexue He, Charles Jin, Aldo Pareja, Dan Gutfreund, Chuang Gan, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) Stanford(斯坦福大学) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 BOAD通过多臂老虎机问题自动发现层次化多代理结构,提升软件工程任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24684 2026-01-01 cs.CL cs.AI 62%

R-Debater: Retrieval-Augmented Debate Generation through Argumentative Memory

R-Debater:通过论证记忆的检索增强辩论生成

Maoyuan Li, Zhongsheng Wang, Haoyuan Li, Jiamou Liu

机构 * Wuhan College of Communication(武汉通信学院) Wuhan College of Communication University of Auckland(武汉通信学院奥克兰大学) University of Auckland(奥克兰大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 R-Debater通过整合检索和结构化规划,实现了更忠实、一致且连贯的多轮辩论生成。

Comments Accepteed by AAMAS 2026 full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24661 2026-01-01 cs.CL cs.AI 62%

Do Large Language Models Know What They Are Capable Of?

大语言模型是否了解自己的能力?

Casey O. Barkan, Sid Black, Oliver Sourbut

机构 * RAND Corporation(RAND公司) UK AI Security Institute(英国人工智能安全研究所) The Future of Life Foundation(未来生命基金会)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在预测自身能力时存在过度自信,且随着任务推进可能恶化,但通过失败经验可部分缓解,揭示了其能力认知不足的问题。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23906 2026-01-01 eess.SP cs.AI cs.CV cs.LG 62%

A multimodal Transformer for InSAR-based ground deformation forecasting with cross-site generalization across Europe

基于InSAR的地面形变预测的多模态Transformer及欧洲跨站点泛化

Wendong Yao, Binhua Huang, Soumyabrata Dev

机构 * The ADAPT SFI Research Centre, Dublin, Ireland(ADAPT SFI研究机构,都柏林,爱尔兰) School of Computer Science, University College Dublin, Belfield, Dublin, Ireland(计算机科学学院,都柏林大学学院,贝尔菲德,都柏林,爱尔兰)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多模态Transformer模型,用于基于InSAR的地面形变预测,实现欧洲跨站点泛化,提升预测精度和稳定性。

Comments submitted to ISPRS Journal of Photogrammetry and Remote Sensing for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17821 2026-01-01 cs.RO cs.AI cs.LG 62%

CAML: Collaborative Auxiliary Modality Learning for Multi-Agent Systems

CAML: 多智能体系统中的协同辅助模态学习

Rui Liu, Yu Shen, Peng Gao, Pratap Tokekar, Ming Lin

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Adobe Research(Adobe 研究院) North Carolina State University(北卡罗来纳州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CAML通过多智能体协作和共享多模态数据,提升多模态学习在资源受限环境下的性能,实现事故检测和语义分割的显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22768 2025-12-30 cs.LG cs.AI stat.ML 62%

Understanding the Mechanisms of Fast Hyperparameter Transfer

理解快速超参数转移的机制

Nikhil Ghosh, Denny Wu, Alberto Bietti

机构 * Flatiron Institute(Flatiron研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了深度学习中快速超参数转移的机制,通过理论分析和实验验证,揭示了转移策略在不同问题结构下的有效性及计算效率。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21723 2025-12-29 cs.RO cs.AI cs.LG 62%

HELP: Hierarchical Embodied Language Planner for Household Tasks

家庭任务的分层具身语言规划器HELP

Alexandr V. Korchemnyi, Anatoly O. Onishchenko, Eva A. Bakaeva, Alexey K. Kovalev, Aleksandr I. Panov

机构 * MIRAI Cognitive AI Systems Lab(认知人工智能系统实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 HELP通过分层结构的LLM智能体解决家庭任务中的复杂规划问题,结合自然语言处理与具身智能,实现高效任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21243 2025-12-25 cs.RO cs.AI cs.LG 62%

LookPlanGraph: Embodied Instruction Following Method with VLM Graph Augmentation

LookPlanGraph: 一种基于视觉语言模型图增强的具身指令跟随方法

Anatoly O. Onishchenko, Alexey K. Kovalev, Aleksandr I. Panov

机构 * MIRAI Cognitive AI Systems Lab(认知人工智能系统实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 LookPlanGraph通过动态更新场景图实现具身指令跟随,利用视觉语言模型增强环境感知,优于静态场景图方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18745 2025-12-23 cs.CV cs.CL cs.LG 62%

InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search

InSight-o3: 通过通用视觉搜索增强多模态基础模型

Kaican Li, Lewei Yao, Jiannan Wu, Tiezheng Yu, Jierun Chen, Haoli Bai, Lu Hou, Lanqing Hong, Wei Zhang, Nevin L. Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 InSight-o3通过通用视觉搜索任务提升多模态基础模型的推理能力,解决复杂视觉信息整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14918 2025-12-23 cs.CL cs.LG stat.ML 62%

Reliable Decision Support with LLMs: A Framework for Evaluating Consistency in Binary Text Classification Applications

利用LLM实现可靠决策支持:一种评估二元文本分类应用一致性的框架

Fadel M. Megahed, Ying-Ju Chen, L. Allision Jones-Farmer, Younghwa Lee, Jiawei Brooke Wang, Inez M. Zwetsloot

机构 * Farmer School of Business, Miami University, Oxford, OH 45056, USA(迈阿密大学法默商学院) College of Arts and Sciences, University of Dayton, Dayton, OH 45469, USA(Dayton大学文理学院) Amsterdam Business School, University of Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹大学阿姆斯特丹商学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种评估LLM在二元文本分类中一致性的框架,通过实验验证了不同模型在金融新闻分类中的性能,并提供了系统化的LLM选择和可靠性评估方法。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17267 2025-12-22 cs.CL cs.AI 62%

AutoMetrics: Approximate Human Judgements with Automatically Generated Evaluators

AutoMetrics: 通过自动生成评估器进行近似人类判断

Michael J. Ryan, Yanzhe Zhang, Amol Salunkhe, Yi Chu, Di Xu, Diyi Yang

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 AutoMetrics通过自动生成评估器,在低数据条件下提升与人类评分的相关性,提高Kendall相关性达33.4%,并提供可解释的自动指标工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13733 2025-12-17 cs.LG cs.AI 62%

Low-Rank Compression of Language Models via Differentiable Rank Selection

通过可微分秩选择实现语言模型的低秩压缩

Sidhant Sundrani, Francesco Tudisco, Pasquale Minervini

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LLRC通过可微分方法实现语言模型的低秩压缩,在无需微调的情况下提升压缩率与下游任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11862 2025-12-16 cs.LG cs.AI 62%

Hierarchical Task Offloading and Trajectory Optimization in Low-Altitude Intelligent Networks Via Auction and Diffusion-based MARL

低空智能网络中的分层任务卸载与轨迹优化:通过拍卖和基于扩散的MARL

Jiahao You, Ziye Jia, Can Cui, Chao Dong, Qihui Wu, Zhu Han

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于拍卖和扩散的MARL方法,用于低空智能网络中的分层任务卸载与轨迹优化,以提升能耗效率和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03343 2025-12-15 cs.CL cs.AI 62%

Idea-Gated Transformers: Enforcing Semantic Coherence via Differentiable Vocabulary Pruning

Idea-Gated Transformers: 通过可微分词汇修剪强制语义一致性

Darshan Fofadiya

机构 * Darshan Fofadiya(独立研究者)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 Idea-Gated Transformers通过可微分词汇修剪机制,实现语义一致性,提升语言模型的领域保留能力与生成可控性。

Comments Code available at https://github.com/DarshanFofadiya/idea-gated-transformers/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15447 2025-12-15 cs.AI cs.LG 62%

From Bits to Boardrooms: A Cutting-Edge Multi-Agent LLM Framework for Business Excellence

从比特到董事会:一种面向企业卓越的多智能体大语言模型框架

Zihao Wang, Junming Zhang

机构 * College of Artificial Intelligence and Automation(人工智能与自动化学院) Hohai University(河海大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 BusiAgent是一种基于多智能体框架的LLM,通过整合CTMDP、熵度量和Stackelberg博弈等创新技术,提升企业决策的效率与质量。

Comments Accepted by ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20875 2025-12-12 cs.LG cs.AI cs.CV 62%

CC-GRMAS: A Multi-Agent Graph Neural System for Spatiotemporal Landslide Risk Assessment in High Mountain Asia

CC-GRMAS:一种用于高亚洲山区时空滑坡风险评估的多智能体图神经系统

Mihir Panchal, Ying-Jung Chen, Surya Parkash

机构 * Department of Computer Engineering(计算机工程系) Dwarkadas Jivanlal Sanghvi College of Engineering(德瓦尔卡斯·吉文拉尔·桑格维学院) College of Computing(计算机学院) Georgia Institute of Technology(佐治亚理工学院) Geo-Hydro Meteorological Risks Management Division(地质-水文气象灾害管理部) National Institute of Disaster Management(国家灾害管理研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 CC-GRMAS通过多智能体图神经系统提升高亚洲山区滑坡风险评估的准确性和响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17158 2025-12-12 cs.AI cs.CL 62%

ARE: Scaling Up Agent Environments and Evaluations

ARE:扩展代理环境和评估

Romain Froger, Pierre Andrews, Matteo Bettini, Amar Budhiraja, Ricardo Silveira Cabral, Virginie Do, Emilien Garreau, Jean-Baptiste Gaya, Hugo Laurençon, Maxime Lecanu, Kunal Malkan, Dheeraj Mekala, Pierre Ménard, Gerard Moreno-Torres Bertran, Ulyana Piterbarg, Mikhail Plekhanov, Mathieu Rita, Andrey Rusakov, Vladislav Vorotilov, Mengjue Wang, Ian Yu, Amine Benhalloum, Grégoire Mialon, Thomas Scialom

机构 * Meta Superintelligence Labs(Meta超级智能实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ARE平台通过Gaia2基准测试代理能力,强调需新架构和适应性计算策略以应对智能光谱的挑战。

Comments Updated authors order and acknowledgement

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09458 2025-12-11 cs.AI cs.LG 62%

Architectures for Building Agentic AI

构建代理AI的架构

Sławomir Nowaczyk

机构 * Center for Applied Intelligent Systems Research, Halmstad University, Sweden(应用智能系统研究所,哈尔姆斯塔德大学,瑞典)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种构建代理AI的架构分类,通过组件化设计和显式控制循环提升系统可靠性。

Comments This is a preprint of a chapter accepted for publication in Generative and Agentic AI Reliability: Architectures, Challenges, and Trust for Autonomous Systems, published by Springer Nature

详情

展开后加载摘要…

URL PDF HTML 收藏