arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11167 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11167 篇

2508.02110 2026-01-08 cs.AI 57%

Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools

吸引性元数据攻击:诱导LLM代理调用恶意工具

Kanghua Mo, Li Hu, Yucheng Long, Zhihao Li

机构 * Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学网络空间研究院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出AMA攻击,通过操纵工具元数据诱导LLM代理调用恶意工具,揭示了系统性安全漏洞。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03098 2026-01-07 cs.LG cs.NE 57%

From Muscle to Text with MyoText: sEMG to Text via Finger Classification and Transformer-Based Decoding

从肌肉到文本:MyoText:通过手指分类和基于Transformer的解码实现sEMG到文本

Meghna Roy Chowdhury, Shreyas Sen, Yi Ding

机构 * Purdue University(普渡大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 MyoText通过手指分类和Transformer解码实现sEMG到文本的高效转换,提升无键盘打字的准确性和可行性。

Comments 25 pages, 11 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02915 2026-01-07 cs.LG 57%

ChemBART: A Pre-trained BART Model Assisting Organic Chemistry Analysis

ChemBART:一种用于有机化学分析的预训练BART模型

Kenan Li, Yijian Zhang, Jin Wang, Haipeng Gan, Zeying Sun, Xiaoguang Lei, Hao Dong

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 ChemBART是一种基于SMILES的预训练模型,通过反应导向的预训练解决多种化学任务,提升合成规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04980 2026-01-07 cs.LG cs.SY eess.SY 57%

Agentic AI for Intent-Based Industrial Automation

基于意图的工业自动化代理AI

Marcos Lima Romero, Ricardo Suyama

机构 * Center for Engineering, Modeling(工程、建模中心) Applied Social Sciences Federal University of ABC - UFABC(应用社会科学联邦大学-UFABC)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出基于意图的工业自动化代理AI框架,通过自然语言表达目标并分解为可执行组件,实现人本、可持续的自动化系统。

Comments Preprint - Submitted to 16th IEEE/IAS International Conference on Industry Applications - INDUSCON 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23659 2026-01-07 cs.CL 57%

Less is more: Probabilistic reduction is best explained by small-scale predictability measures

少即是多:概率性缩减最好由小规模可预测性度量解释

Cassandra L. Jacobs, Andrés Buxó-Lugo, Anna K. Taylor, Marie Leopold-Hooke

机构 * Department of Linguistics, University at Buffalo(语言学系,布法罗大学) Department of Psychology, University at Buffalo(心理学系,布法罗大学) Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文探讨了语言模型概率与认知现象关系中所需上下文量,证明n-gram表示可作为认知规划的单位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01816 2026-01-06 cs.AI 57%

Admissibility Alignment

可接受性对齐

Chris Duffey

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MAP-AI架构,通过蒙特卡洛方法评估决策策略的可接受性,实现AI对齐的动态决策理论属性。

Comments 24 pages, 2 figures, 2 tables.. Decision-theoretic alignment under uncertainty

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01798 2026-01-06 cs.CV cs.AI 57%

VerLM: Explaining Face Verification Using Natural Language

通过自然语言解释面部验证

Syed Abdul Hannan, Hazim Bukhari, Thomas Cantalapiedra, Eman Ansar, Massa Baali, Rita Singh, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种视觉-语言模型用于面部验证,通过自然语言解释决策过程,提升验证的透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01687 2026-01-06 cs.CV cs.AI 57%

FALCON: Few-Shot Adversarial Learning for Cross-Domain Medical Image Segmentation

FALCON:跨域少样本对抗学习用于医学图像分割

Abdur R. Fayjie, Pankhi Kashyap, Jutika Borah, Patrick Vandewalle

机构 * KU Leuven(卢森堡大学) IIT-Bombay(印度理工学院-孟买) Tezpur University(泰浦大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 FALCON通过跨域少样本对抗学习实现高精度医学图像分割,以更少的数据和计算开销获得更优的边界精度和分割性能。

Comments 20 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00818 2026-01-06 cs.AI 57%

Agentic AI for Autonomous, Explainable, and Real-Time Credit Risk Decision-Making

代理AI用于自主、可解释和实时的信用风险决策制定

Chandra Sekhar Kubam

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出代理AI框架,通过多代理系统实现自主、可解释和实时的信用风险决策,提升决策效率并应对监管与技术挑战。

Comments 8 pages

Journal ref INTELLIGENT SYSTEMS AND APPLICATIONS IN ENGINEERING, vol 12 No23, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00696 2026-01-05 cs.LG cs.GT cs.RO 57%

Bayesian Inverse Games with High-Dimensional Multi-Modal Observations

高维多模态观测下的贝叶斯逆游戏

Yash Jain, Xinjie Liu, Lasse Peters, David Fridovich-Keil, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Delft University of Technology(代尔夫特理工大学) Sunrise Setting Ltd SAGE Publications Ltd(SAGE出版社有限公司)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出了一种基于贝叶斯推断的逆博弈框架,利用多模态观测数据实时生成隐藏智能体目标的后验分布,提升推断质量并实现更安全的决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00482 2026-01-05 cs.SE cs.AI 57%

Multi-Agent Coordinated Rename Refactoring

多智能体协同重命名重构

Abhiram Bellur, Mohammed Raihan Ullah, Fraol Batole, Mohit Kansara, Masaharu Morimoto, Kai Ishikawa, Haifeng Chen, Yaroslav Zharov, Timofey Bryksin, Tien N. Nguyen, Hridesh Rajan, Danny Dig

机构 * University of Colorado(科罗拉多大学) Tulane University(路易斯安那大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) NEC Corporation(日本电气通信事业株式会社) NEC Laboratories America(NEC美国实验室) JetBrains Research(JetBrains研究)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种多智能体框架,通过协同重命名重构自动化减少开发者负担,提升重构效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00421 2026-01-05 cs.AI 57%

Can Semantic Methods Enhance Team Sports Tactics? A Methodology for Football with Broader Applications

语义方法能否提升团队体育战术?一种适用于足球的通用方法

Alessio Di Rubbo, Mattia Neri, Remo Pareschi, Marco Pedroni, Roberto Valtancoli, Paolino Zica

机构 * Stake Lab, University of Molise, Italy(斯泰克实验室,莫利塞大学,意大利) Bioretics, Bologna, Italy(生物反应公司,博洛尼亚,意大利) Institute for Generative Strategy, Ferrara, Italy(生成战略研究所,费拉拉,意大利) Cesena Femminile Football Club, Cesena, Italy(塞斯纳女子足球俱乐部,塞斯纳,意大利) Zica Sport, Benevento, Italy(齐卡体育,贝内文托,意大利)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于语义空间推理的团队体育战术决策方法,通过多维向量表示球员属性并评估战术契合度,为足球及其他团队领域提供通用决策框架。

Comments Submitted to Sci (MDPI) for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00257 2026-01-05 eess.SY cs.AI cs.CV cs.MA cs.NI cs.SY 57%

Next Generation Intelligent Low-Altitude Economy Deployments: The O-RAN Perspective

下一代智能低空经济部署:O-RAN视角

Aly Sabri Abdalla, Vuk Marojevic

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于O-RAN的低空经济框架,利用AI优化实现闭环任务协调,通过语义感知rApp和强化学习xApp提升轨迹规划性能。

Comments This article has been accepted for publication in the IEEE Wireless Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00142 2026-01-05 cs.AI 57%

An AI Monkey Gets Grapes for Sure -- Sphere Neural Networks for Reliable Decision-Making

一个AI猴子确保能拿到葡萄——用于可靠决策的球神经网络

Tiansi Dong, Henry He, Pietro Liò, Mateja Jamnik

机构 * Phillips Academy Andover(安多弗菲利普斯学术 academy)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出球神经网络,通过在n维球面上嵌入概念,实现可靠决策,能掌握16种三段论任务。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00088 2026-01-05 cs.LG 57%

Dynamic Bayesian Optimization Framework for Instruction Tuning in Partial Differential Equation Discovery

用于偏微分方程发现的动态贝叶斯优化框架用于指令微调

Junqi Qu, Yan Zhang, Shangqian Gao, Shibo Li

机构 * Department of Computer Science, Florida State University(佛罗里达州立大学计算机科学系)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 NeuroSymBO通过动态贝叶斯优化框架提升偏微分方程发现任务中的指令微调效果,实现更优的解决方案和更高的恢复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24652 2026-01-05 cs.CL cs.IR 57%

Optimizing Retrieval for RAG via Reinforcement Learning

通过强化学习优化RAG的检索

Jiawei Zhou, Lei Chen

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 通过强化学习优化RAG检索,提升检索性能并适应多样化环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24947 2026-01-01 cs.CV cs.CL 57%

CPJ: Explainable Agricultural Pest Diagnosis via Caption-Prompt-Judge with LLM-Judged Refinement

CPJ: 通过基于提示-判断的图像描述实现可解释的农业害虫诊断

Wentao Zhang, Tao Fang, Lina Lu, Lifei Wang, Weihe Zhong

机构 * Business School, Shandong University of Technology, Shandong, China(山东科技大学商学院) Institute of International Language Services Studies, Macau Millennium College, Macau SAR, China(国际语言服务研究所,澳门 Millennium 学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 CPJ通过基于提示-判断的图像描述实现可解释的农业害虫诊断,无需训练即可提升诊断性能。

Comments This paper is 6 pages in length and contains 2 figures. Tao Fang (Corresponding Author), Lina Lu (Co-corresponding Author)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02761 2026-01-01 cs.AI 57%

Plan Verification for LLM-Based Embodied Task Completion Agents

基于大语言模型的体感任务完成代理的计划验证

Ananth Hariharan, Vardhan Dongre, Dilek Hakkani-Tür, Gokhan Tur

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于自然语言提示的体感任务代理计划验证框架,通过迭代修正提升动作序列质量,实现高召回率和精确度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24189 2026-01-01 cs.AI cs.MA 57%

SCP: Accelerating Discovery with a Global Web of Autonomous Scientific Agents

SCP:通过全球自主科学代理网络加速发现

Yankai Jiang, Wenjie Lou, Lilong Wang, Zhenyu Tang, Shiyang Feng, Jiaxuan Lu, Haoran Sun, Yaning Pan, Shuang Gu, Haoyang Su, Feng Liu, Wangxu Wei, Pan Tan, Dongzhan Zhou, Fenghua Ling, Cheng Tan, Bo Zhang, Xiaosong Wang, Lei Bai, Bowen Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 SCP通过全球自主科学代理网络,实现科学资源的统一整合与实验生命周期管理,提升跨平台协作效率和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24077 2026-01-01 cs.AI 57%

LoongFlow: Directed Evolutionary Search via a Cognitive Plan-Execute-Summarize Paradigm

LoongFlow:通过认知计划-执行-总结范式实现定向进化搜索

Chunhui Wan, Xunan Dai, Zhuo Wang, Minglei Li, Yanpeng Wang, Yinan Mao, Yu Lan, Zhiwen Xiao

机构 * Baidu Inc(百度公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 LoongFlow通过认知计划-执行-总结范式实现高效进化搜索,提升算法发现与流水线优化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24040 2026-01-01 cs.AI 57%

ROAD: Reflective Optimization via Automated Debugging for Zero-Shot Agent Alignment

ROAD: 通过自动调试实现零样本智能体对齐的反思优化

Natchaya Temyingyong, Daman Jain, Neeraj Kumarsahu, Prabhat Kumar, Rachata Phondi, Wachiravit Modecrua, Krittanon Kaewtawee, Krittin Pachtrachai, Touchapon Kraisingkorn

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 ROAD通过自动调试实现零样本智能体对齐的反思优化,利用多智能体架构将无结构故障日志转化为结构化决策树协议,提升智能体性能和样本效率。

Comments 22 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03142 2026-01-01 cs.LG 57%

Not All Tokens Are Meant to Be Forgotten

并非所有标记都旨在被遗忘

Xiangyu Zhou, Yao Qiang, Saleh Zare Zade, Douglas Zytko, Prashant Khanduri, Dongxiao Zhu

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出TIF框架,通过目标信息标识符和偏好优化方法,解决LLM过度遗忘问题,提升去学习效果并保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23722 2026-01-01 cs.CL 57%

Emergent World Beliefs: Exploring Transformers in Stochastic Games

涌现的世界信念:探索变换器在随机游戏中的应用

Adam Kamel, Tanish Rastogi, Michael Ma, Kailash Ranganathan, Kevin Zhu

机构 * University of Waterloo(多伦多大学) University of California, Berkeley(加州大学伯克利分校) Algoverse AI Research(Algoverse人工智能研究)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了LLMs在扑克等信息不完全领域中学习随机环境表示的能力,通过预训练和内部激活探测,展示了模型能自主学习确定性和随机性特征。

Comments Accepted at NeurIPS 2025 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23217 2025-12-30 cs.AI 57%

TCEval: Using Thermal Comfort to Assess Cognitive and Perceptual Abilities of AI

TCEval:利用热舒适性评估人工智能的认知与感知能力

Jingming Li

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 TCEval通过热舒适性场景评估AI的跨模态推理、因果关联和适应性决策能力,揭示当前LLM在热舒适性领域存在基础推理能力但缺乏精确因果理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20491 2025-12-30 cs.CL 57%

Step-DeepResearch Technical Report

Step-DeepResearch 技术报告

Chen Hu, Haikuo Du, Heng Wang, Lin Lin, Mingrui Chen, Peng Liu, Ruihang Miao, Tianchi Yue, Wang You, Wei Ji, Wei Yuan, Wenjin Deng, Xiaojian Yuan, Xiaoyun Zhang, Xiangyu Liu, Xikai Liu, Yanming Xu, Yicheng Cao, Yifei Zhang, Yongyao Wang, Yubo Shu, Yurong Zhang, Yuxiang Zhang, Zheng Gong, Zhichao Chang, Binyan Li, Dan Ma, Furong Jia, Hongyuan Wang, Jiayu Liu, Jing Bai, Junlan Liu, Manjiao Liu, Na Wang, Qiuping Wu, Qinxin Du, Shiwei Li, Wen Sun, Yifeng Gong, Yonglin Chen, Yuling Zhao, Yuxuan Lin, Ziqi Ren, Zixuan Wang, Aihu Zhang, Brian Li, Buyun Ma, Kang An, Li Xie, Mingliang Li, Pan Li, Shidong Yang, Xi Chen, Xiaojia Liu, Yuchu Luo, Yuan Song, YuanHao Ding, Yuanwei Liang, Zexi Li, Zhaoning Zhang, Zixin Zhang, Binxing Jiao, Daxin Jiang, Jiansheng Chen, Jing Li, Xiangyu Zhang, Yibo Zhu

机构 * Step-DeepResearch

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 Step-DeepResearch通过原子能力数据合成策略和渐进式训练路径,实现低成本高效率的深度研究代理,实验表明其在Scale AI Research Rubrics和ADR-Bench上的表现优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22435 2025-12-30 cs.AR cs.LG 57%

AnalogSAGE: Self-evolving Analog Design Multi-Agents with Stratified Memory and Grounded Experience

AnalogSAGE: 带分层记忆和基础经验的自进化模拟设计多智能体

Zining Wang, Jian Gao, Weimin Fu, Xiaolong Guo, Xuan Zhang

机构 * Northeastern University(东北大学) Kansas State University(堪萨斯州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 AnalogSAGE通过分层记忆和基础经验提升模拟设计自动化可靠性与自主性

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22408 2025-12-30 cs.RO cs.AI 57%

A Unified AI, Embedded, Simulation, and Mechanical Design Approach to an Autonomous Delivery Robot

一种整合人工智能、嵌入式系统、仿真和机械设计的自主配送机器人方法

Amro Gamar, Ahmed Abduljalil, Alargam Mohammed, Ali Elhenidy, Abeer Tawakol

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种整合人工智能、嵌入式系统、仿真和机械设计的自主配送机器人方法,通过异构计算架构和优化设计实现了高可靠性和实时控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22087 2025-12-29 cs.CL 57%

Context as a Tool: Context Management for Long-Horizon SWE-Agents

上下文作为工具:长周期SWE代理的上下文管理

Shukai Liu, Jian Yang, Bo Jiang, Yizhi Li, Jinyang Guo, Xianglong Liu, Bryan Dai

机构 * Beihang University(北航大学) Manchester(曼彻斯特) Ubiquant

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 CAT通过整合上下文管理工具,提升SWE代理的长周期推理能力,实验表明其在SWE-Bench-Verified上达到57.6%的解决率,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21915 2025-12-29 cs.LG cs.DB 57%

Exploring the Heterogeneity of Tabular Data: A Diversity-aware Data Generator via LLMs

探索表格数据的异质性:通过LLMs的多样性感知数据生成器

Yafeng Tang, Xiaoou Ding, Jianzhuo Du, Zishuo Yan, Zhuang Ma, Zheng Liang, Zekai Qian, Hongzhi Wang

机构 * Hongzhi Wang(王 Hongzhi)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 DATE通过LLMs生成多样化且高质量的表格数据,有效提升机器学习模型的性能与推理能力。

Comments This manuscript has been submitted to IEEE Transactions on Knowledge and Data Engineering (TKDE) for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21623 2025-12-29 cs.AI cs.MA q-bio.QM 57%

Democratizing Drug Discovery with an Orchestrated, Knowledge-Driven Multi-Agent Team for User-Guided Therapeutic Design

用协同、知识驱动的多智能体团队实现药物发现民主化

Takahide Suzuki, Kazuki Nakanishi, Takashi Fujiwara, Hideyuki Shimizu

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 OrchestRA通过协同、知识驱动的多智能体团队,整合生物学、化学和药理学,实现药物发现的自主化与民主化,推动其从随机搜索向可编程证据工程转型。

Comments 51 pages, 4 figures (with supplementary information)

详情

展开后加载摘要…

URL PDF HTML 收藏