arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1002 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1002 篇

2607.04763 2026-07-28 cs.LG cs.AI cs.CL stat.ML 版本更新 75%

Multi-Turn On-Policy Distillation with Prefix Replay

基于前缀重放的多轮在线策略蒸馏

Baohao Liao, Hanze Dong, Christof Monz, Xinxing Xu, Li Dong, Furu Wei

机构 * Microsoft Research(微软研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究用于智能体任务的在线策略蒸馏,提出重放前缀在线策略蒸馏方法,复用预收集教师轨迹作重放前缀,解决多轮在线策略蒸馏的前缀陷阱问题,提高效率且保持或提升精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21133 2026-07-09 cs.RO 版本更新 75%

Humanoid Whole-Body Manipulation via Active Spatial Brain and Generalizable Action Cerebellum

通过主动空间大脑和可泛化动作小脑的人形全身 manipulation

Zhizhao Liang, Yi-Lin Wei, Xuhang Chen, Mu Lin, Yi-Xiang He, Zhexi Luo, Jun-Hui Liu, Kun-Yu Lin, Wei-Shi Zheng

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University(工程学院,中山大学)

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出了一种通用的人形 locomotion-manipulation 框架,通过主动空间大脑和可泛化动作小脑来解决复杂3D环境中空间理解困难和动作生成泛化困难的问题,展示了在多种任务和环境中的强性能。

Comments Project page: https://leungchaos.github.io/Humanoid-Whole-Body-Manipulation-via-Active-Spatial-Brain-and-Generalizable-Action-Cerebellum/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05922 2026-06-11 cs.AI cs.CL cs.LG 版本更新 75%

Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference

回顾性工具优化:通过轨迹回滚上的自我偏好改进LLM智能体

Wenbo Pan, Shujie Liu, Chin-Yew Lin, Jingying Zeng, Xianfeng Tang, Xiangyang Zhou, Yan Lu, Xiaohua Jia

机构 * City University of Hong Kong(香港城市大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出一种自监督方法RHO,利用历史轨迹回滚和自偏好选择优化智能体工具集,无需真实标签,在SWE-Bench Pro上通过单轮优化将通过率从59%提升至78%。

Comments Code: https://github.com/wbopan/retro-harness ; Project website: https://paper-rho.wenbo.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19314 2026-06-11 cs.AI cs.CL cs.LG 版本更新 75%

PRInTS: Reward Modeling for Long-Horizon Information Seeking

PRInTS:面向长程信息检索的奖励建模

Jaewoo Lee, Archiki Prasad, Justin Chih-Yao Chen, Zaid Khan, Elias Stengel-Eskin, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出PRInTS生成式过程奖励模型,通过密集评分和轨迹摘要提升长程信息检索中工具交互与推理能力,在多个基准上超越前沿模型。

Comments ACL 2026, 19 pages, code: https://github.com/G-JWLee/PRInTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09809 2026-06-10 cs.CV 版本更新 75%

SciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse Parsing

SciFlow-Bench:通过逆解析评估结构感知的科学图表生成

Tong Zhang, Honglin Lin, Zhou Liu, Chong Chen, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Huawei Cloud BU(华为云业务部) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学))

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 提出SciFlow-Bench基准,通过逆解析将生成的图表图像转换为结构化图进行比较,以结构可恢复性而非视觉相似性评估科学图表生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14380 2026-06-08 cs.RO 版本更新 75%

CRAFT: Coaching Reinforcement Learning Autonomously using Foundation Models for Multi-Robot Coordination Tasks

CRAFT:利用基础模型自主教练强化学习以完成多机器人协调任务

Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

机构 * Department of Mechanical Engineering, University of California Berkeley(机械工程系,加州大学伯克利分校)

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 提出CRAFT框架,利用大语言模型分解任务、生成奖励函数,并通过视觉语言模型优化,实现多机器人协调学习,在四足导航和双臂操作任务中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14211 2026-06-09 cs.AI cs.LG 版本更新 74%

ASH: Agents that Self-Hone via Embodied Learning

ASH: 通过具身学习自我精炼的智能体

Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun

机构 * University of Waterloo(多伦多大学) National Research Council Canada(加拿大国家研究理事会)

专题命中 规划决策 :planning(abstract);agentic(abstract);分类 cs.AI、cs.LG;AI agent(comments)

AI总结 提出ASH系统,通过从无标签互联网视频中学习具身策略,利用自改进循环和逆动力学模型,在长时域任务中显著超越基线方法。

Comments Published as a workshop paper at ICML 2026 Workshop on Scalable Learning and Optimization for Efficient Multimodal AI Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31222 2026-08-19 cs.AI 版本更新 74%

Thinking Before Retrieving: Robust Zero-Shot Composed Image Retrieval via Strategic Planning and Self-Criticism

先思考再检索:通过战略规划与自我批评实现鲁棒的零样本组合图像检索

Gunho Jung, Jeong-Woo Park, Seon Bin Kim, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(高丽大学人工智能系)

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 提出PEC-CIR框架,通过规划器-执行器-批评家多阶段推理流水线构建查询,在零样本组合图像检索中减少生成错误,提升检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05033 2026-08-14 cs.DC cs.LG 版本更新 74%

SparseDitto: Customizing GPU Kernels for Different Sparsity Patterns with LLM-Based Agentic System

SparseDitto:基于大语言模型的智能体系统,为不同稀疏性模式定制GPU内核

Shiyang Li, Guangyan Sun, Jinwei Tang, Yanzhi Wang, Mingyi Hong, Caiwen Ding

专题命中 规划决策 :agentic(title);分类 cs.LG

AI总结 SparseDitto是基于LLM的系统,可为不同矩阵、算子和GPU定制稀疏矩阵GPU内核,在多类算子与GPU上较cuSPARSE实现显著加速,还可提升GCN训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00485 2026-08-05 cs.CL 版本更新 74%

SERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic Learning

SERL-SQL:面向Text-to-SQL强化智能体学习的选择性回溯蒸馏

Tao Liu, Tao Feng, Xiangheng Li, Jinwang Song, Yifan Li, Xiaoqing Cheng, Dixuan Zhang, Siquan Li, Lin Lan, Hongying Zan, Kunli Zhang, Chao Wu

专题命中 规划决策 :agentic(title);分类 cs.CL

AI总结 该研究针对现有Text-to-SQL强化学习方法奖励指导不足的问题,提出SERL-SQL框架,通过教师模型重评分与掩码权重优化GRPO优势,在BIRD、Spider等基准上取得优异执行准确率,其奖励选择策略表现优于一致性选择。

Comments 9 pages,6 figures, Underreview

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24341 2026-08-04 cs.AI 版本更新 74%

Simulating Tenant Responses to Energy Policy Interventions with Transaction-Cost-Aware LLM Agent

使用具有交易成本意识的大语言模型模拟租户对能源政策干预的反应

Weijie Xia, Stefanie Horian, Hanyue Huang, Queena K. Qian, Jie Yang, Pedro P. Vergara

机构 * Mistral AI(米斯特拉尔人工智能公司) Ollama(奥拉马)

专题命中 规划决策 :agent(title);分类 cs.AI

AI总结 研究利用感知交易成本,开发摩擦感知角色建模方法,以模拟租户对能源政策干预的反应。通过荷兰公民调查数据,比较不同模型和设置,发现纳入该方法能提升模型性能,为政策理论与LLM政策模拟搭建桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27814 2026-08-04 cs.AI 版本更新 74%

ATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic Tasks

ATOD: 面向多轮自主智能体的退火轮次感知在线策略蒸馏

Qitai Tan, Zefang Zong, Mo Li, Yipeng Shi, Yang Li, Peng Chen

机构 * Tencent Inc.(腾讯公司) Tsinghua University(清华大学)

专题命中 规划决策 :agentic(title);分类 cs.AI

AI总结 提出ATOD混合在线蒸馏算法,通过退火式OPD-RL调度和轮次级重加权,解决长程交互任务中OPD性能天花板和RL早期低效问题,在三个基准上超越教师模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20253 2026-07-30 cs.SD cs.AI eess.AS 版本更新 74%

Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

推动全曲生成的前沿:分层自回归规划与流匹配渲染

Junyu Dai, Xinyue Fan, Weiqin Li, Xiangang Li, Yunjia Li, Bin Ma, Yukun Ma, Chongjia Ni, Yufei Shi, Biao Tian, Haoxu Wang, Menglin Wu, Jianwei Yu, Huaicheng Zhang, Han Zhao, Shengkui Zhao, Haina Zhu

机构 * Alibaba(阿里巴巴)

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 该研究提出统一歌曲生成框架,支持多项任务,由四个组件构成。通过特定编码、建模、匹配及模块实现歌曲生成,还研究多种后训练策略,实验表明该框架在评估中性能具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05000 2026-07-17 cs.CR cs.LG 版本更新 74%

Agentic Vulnerability Reasoning on COTS Binaries

基于商用现货二进制文件的智能体漏洞推理

Hwiwon Lee, Jongseong Kim, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agentic(title);分类 cs.LG

AI总结 研究LLM智能体对COTS二进制文件漏洞的推理能力,构建SLYP管道,结合二进制探索与动态调试验证漏洞。在COM基准测试中表现出色,发现更多真实漏洞,生成验证PoC,还发现多个零日漏洞,证明工具集和模型选择的重要性及通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16794 2026-08-20 cs.RO cs.AI cs.CL 版本更新 73%

Neurosymbolic Embodied Agents

神经符号具身智能体

Mohammad Albinhassan, Yuming Feng, Alessandra Russo, Pranava Madhyastha

机构 * Imperial College London(帝国理工学院) Johns Hopkins University(约翰斯·霍普金斯大学) City, University of London(伦敦城市大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出一种神经符号具身智能体,将长周期家庭任务分解为视觉探索与符号规划,在VirtualHome、ALFWorld基准测试中表现优异,约束与搜索结合可大幅提升任务解决率,且无需专门训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10444 2026-08-13 cs.CL cs.AI 版本更新 73%

From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models

从推理深度到推理广度:评估大型语言模型中的多点关联推理

Si'an Xie, Jiaxun Liu, Biao Yang, Wei Yuan, Fan Yang, Tingting Gao, Ming Wu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究构建了中英双语多点关联推理基准MPAR-Bench,发现大型语言模型的推理深度未自动带来稳健的推理广度,当前基准未充分覆盖推理广度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16057 2026-08-12 cs.CL cs.AI 版本更新 73%

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning

跨商业学科的前沿人工智能性能:基于案例的知识工作和分析推理基准

Ajay Patel, Kartik Hosanagar, Ramayya Krishnan, Chris Callison-Burch, Karim Lakhani

机构 * The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院) Carnegie Mellon University(卡内基梅隆大学) Harvard Business School, Harvard University(哈佛大学哈佛商学院)

专题命中 规划决策 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究针对人工智能在白领分析性知识工作衡量上的差距,利用顶尖商学院案例教学法构建BusinessCaseBench基准,发现前沿AI模型在此基准上得分高且能力提升快,为商学院及相关职业角色带来启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23146 2026-08-12 cs.LG cs.AI 版本更新 73%

Infra-Bayesian Reinforcement Learning Agents Outperform Classical RL For Worst-Case Robustness

Infra-Bayesian 强化学习智能体在最坏情况鲁棒性上优于经典强化学习

Manish Aryal, Faiyaz Azam, Agnivo Banerjee, Syed Mahir Ahamed, Sai Sidhanth Manoharan Jayanthi, Allegra Laro, Clément Legentilhomme, Andrew Lin, Florian Lorkowski, Marina Pérez del Valle, Radman Rakhshandehroo, Patric Rommel, Emanuel Ruzak, Nathan Theng, Paul Yushin Rapoport

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) WorldQuant University(WorldQuant大学) UC Berkeley(加州大学伯克利分校) Aix-Marseille University(阿维尼翁-马赛大学) MIT(麻省理工学院) University of Zurich(苏黎世大学) University of British Columbia(不列颠哥伦比亚大学) University of Stuttgart(斯图加特大学) University of Buenos Aires(布宜诺斯艾利斯大学) California State University, Fresno(弗雷斯诺加州州立大学) University of Chicago(芝加哥大学)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 针对经典强化学习在模型误设和策略依赖不确定性下的失败,提出 Infra-Bayesian 框架,通过区分概率不确定性和 Knightian 不确定性并采用最坏情况决策,在有限状态无状态决策问题中实现更低的最坏情况遗憾。

Comments RLC 2026: Accepted to Finding the Frame Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24188 2026-08-12 cs.CL cs.LG 版本更新 73%

MT-PingEval: Evaluating Multi-Turn Collaboration with Private Information Games

MT-PingEval:通过私人信息游戏评估多轮协作

Jacob Eisenstein, Fantine Huot, Adam Fisch, Jonathan Berant, Mirella Lapata

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 MT-PingEval通过私人信息游戏评估语言模型在多轮协作中的表现,发现其在规划和执行多轮对话方面存在显著缺陷,并强调了提高对话连贯性和信息管理的重要性。

Comments CoLM camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13084 2026-08-04 cs.LG cs.AI 版本更新 73%

Belief-Contraction-Driven Active Inverse Source Localization and Characterization

基于信念收缩的主动逆源定位与表征

Yiwei Shi, Mengyue Yang, Qi Zhang, Cunjia Liu, Weinan Zhang, Weiru Liu

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对动态场主动逆源定位与表征问题,提出信念收缩驱动的ATT-PFRL方法,统一推断、停止与控制,在多场景下较基线方法实现更高完成度、更快收敛与更准定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19450 2026-07-30 cs.LG cs.AI 版本更新 73%

REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning

REGEN:用于从专家到通用模型蒸馏的离线强化学习的重放回收

Yunjie Chen, Xiaoxin Chen, Fang Wang

机构 * vivo AI Lab(vivo人工智能实验室) Department of Computer Science, Sun Yat-Sen University(中山大学计算机科学系)

专题命中 规划决策 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型强化学习扩展的挑战,提出REGEN方法,通过回收重放记忆并运用离线强化学习算法训练通用模型,解耦训练过程,降低成本,在多任务上以低成本达类似准确率,还可能变革在线强化学习及扩展训练阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19321 2026-07-30 cs.AI cs.CR cs.LG 版本更新 73%

ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D

研究竞技场:评估自动化人工智能研发中的破坏行为与监控

Lena Libon, Ben Rank, Jehyeok Yeon, David Schmotz, Jeremy Qin, Daniel Donnelly, Derck Prinzhorn, Maksym Andriushchenko

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对自动化人工智能研发,用研究竞技场框架评估人工智能控制,通过四项长期任务及两类隐藏附带任务,评估前沿代理破坏与监控能力,发现训练数据中破坏行为难捕捉,发布框架用于评估自动化人工智能研发中的破坏与控制。

Comments 50 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23071 2026-07-21 cs.CL cs.AI 版本更新 73%

From Evidence to Trajectory: Abductive Reasoning Path Synthesis for Retrieval-Augmented Generation Agents Development

从证据到轨迹:用于检索增强生成智能体开发的溯因推理路径合成

Muzhi Li, Jinhu Qi, Yihong Wu, Minghao Zhao, Liheng Ma, Yifan Li, Xinyu Wang, Zhenghan Tai, Zixing Song, Yingxue Zhang, Ho-fung Leung, Irwin King

机构 * The Chinese University of Hong Kong, Sha Tin, NT, Hong Kong(香港中文大学) Université de Montréal, Montréal, Quebéc, Canada(蒙特利尔大学) McGill University, Montréal, Quebéc, Canada(麦吉尔大学) Mila - Quebéc AI Institute, Montréal, Quebéc, Canada(魁北克AI研究院) Huawei Noah’s Ark Lab, Montréal, Quebéc, Canada(华为诺亚实验室)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 针对检索增强生成智能体开发缺乏可执行轨迹问题,提出EviPath范式,通过溯因子任务规划、忠实子问题回答、对话微调三个阶段合成推理路径,实验表明基于此训练的模型在开放域问答中显著优于基线。

Comments KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16395 2026-07-14 cs.AI cs.SE 版本更新 73%

LLM-Driven Collaborative Model for Untangling Commits via Explicit and Implicit Dependency Reasoning

基于显式和隐式依赖推理的大语言模型驱动的提交解缠协作模型

Bo Hou, Xin Tan, Kai Zheng, Fang Liu, Yinghao Zhu, Li Zhang

机构 * State Key Laboratory of Complex \& Critical Software Environment (SKLCCSE), School of Computer Science Engineering, Beihang University Beijing China SKLCCSE, School of Computer Science School of Computing Data Science, The University of Hong Kong Hong Kong SAR China Engineering, Beihang University Data Science, The University of Hong Kong

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 针对开发者常产生的缠结提交问题,提出ColaUntangle协作框架,集成大语言模型驱动智能体,构建显式和隐式上下文捕捉信息,经实验验证,该框架在提交解缠任务中性能优于基线,凸显基于大语言模型协作框架的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20140 2026-07-13 cs.AI cs.LG 版本更新 73%

HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs

HiPO:用于大语言模型自适应推理的分层偏好优化

Darsh Kachroo, Arjun Prasaath Anbazhagan, Adriana Caraeni, Brennan Lagasse, Kevin Zhu

机构 * Vellore Institute of Technology(维洛雷理工学院) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Northwestern University(西北大学) Yale University(耶鲁大学) Algoverse AI Research(Algoverse AI研究)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 HiPO通过分层优化提升大语言模型在复杂推理任务中的表现,结合偏好优化与结构化推理的优势,实现更高效的训练和更一致的输出。

Comments 12 pages, 4 figures, 6 tables. Includes ablation study across Qwen2.5-7B-Instruct and Llama-3.1-8B-Instruct on 5 math reasoning benchmarks (GSM8K, MATH500, Minerva, AIME24, Gaokao2023). GPT-4.1 used for structured evaluation of reasoning quality

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06288 2026-07-03 cs.AI cs.LG 版本更新 73%

BuilderBench: The Building Blocks of Intelligent Agents

BuilderBench:智能体的构建模块

Raj Ghugare, Roger Creus Castanyer, Catherine Ji, Kathryn Wantlin, Jin Schofield, Karthik Narasimhan, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) Mila – Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出BuilderBench基准,通过开放式探索训练智能体构建结构,实验表明现有前沿语言模型和强化学习算法无法解决任何非平凡任务。

Comments Blogpost: https://rajghugare19.github.io/builderbench and Code: https://github.com/rajghugare19/builderbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12056 2026-07-02 cs.AI cs.CL 版本更新 73%

XSkill: Continual Learning from Experience and Skills in Multimodal Agents

XSkill: 多模态智能体中的经验与技能持续学习

Guanyu Jiang, Zhaochen Su, Xiaoye Qu, Yi R. Fung

机构 * Zhejiang University(浙江大学)

专题命中 规划决策 :tool use(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 提出XSkill双流框架,通过视觉经验与技能的知识提取、检索和自适应,实现多模态智能体在开放场景中无需参数更新的持续学习,显著提升工具使用和推理泛化能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09045 2026-07-01 cs.AI cs.CR cs.SE 版本更新 73%

Containment Verification: AI Safety Guarantees Independent of Alignment

包含性验证:与对齐无关的AI安全保证

Royce Moon, Lav R. Varshney

机构 * AI Innovation Institute, Stony Brook University(石溪大学人工智能创新研究所)

专题命中 规划决策 :AI agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出包含性验证,通过代理框架本身提供安全保证。通过前向模拟细化和Dafny机制化,证明了在模型类型动作边界内对所有AI输出的边界策略强制性,首次实现了代理框架的演绎形式验证。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09893 2026-06-23 cs.CL cs.AI 版本更新 73%

Pseudo-Deliberation in Language Models: When Reasoning Fails to Align Values and Actions

语言模型中的伪 deliberation:当推理无法使价值观与行动一致时

Sushrita Rakshit, Hanwen Zhang, Hua Shen

机构 * New York University(纽约大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文研究了语言模型中价值观与行动不一致的问题,提出伪 deliberation 概念,并通过 VALDI 框架评估对齐程度,发现不同模型在生成对话中存在一致的偏差。

Comments 9 pages, 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22901 2026-08-07 math.AT 版本更新 71%

Motion Planning on One-Dimensional Peano Continua

一维皮亚诺连续统上的运动规划

Jeremy Brazas, Petar Pavesic

专题命中 规划决策 :planning(title)

AI总结 该研究将一维空间的Lusternik-Schnirelmann范畴与拓扑复杂度定义为闭滤过长度,依据皮亚诺连续统的野性秩刻画其数值,发现其可任意高,与一维CW复形结果形成对比。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏