arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11088 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11088 篇

2406.07089 2026-07-08 cs.CV 版本更新 67%

RS-Agent: Automating Remote Sensing Tasks through Intelligent Agent

RS-Agent:通过智能代理实现遥感任务自动化

Wenjia Xu, Zijian Yu, Boyang Mu, Jiuniu Wang, Zhiwei Wei, Mugen Peng

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing 100876, China(网络与交换技术国家重点实验室,北京邮电大学,中国) City University of HongKong, Hong Kong 999077, China(香港城市大学,中国) School of Geographic Sciences, Hunan Normal University, Changsha 410081, China(地理科学学院,湖南师范大学,中国)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 针对多模态大语言模型在遥感任务中的局限,提出RS-Agent智能代理,通过结构化任务规划等连接用户意图与遥感流程,含四个组件及两种方法,实验显示其在多任务中显著优于现有模型,证明结合两者用于智能地理空间分析的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05369 2026-07-07 cs.RO cs.AI cs.CL cs.LG 新提交 67%

GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks

GaP:面向变分自动化任务的图即策略多智能体自学习框架

Kaiyuan Chen, Shuangyu Xie, Letian Fu, Justin Yu, William Pacini, Sandeep Bajamahal, Hudson Kim, Jaimyn Drake, Daehwa Kim, Haoru Xue, Jonathan Francis, Christian Juette, Peter Schaldenbrand, Muhammet Yunus Seker, Ruwan Wickramarachchi, Uksang Yoo, Guanzhi Wang, Adithyavairavan Murali, Balakumar Sundaralingam, S. Shankar Sastry, Spencer Huang, Yuke Zhu, Linxi "Jim" Fan, Ken Goldberg

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) Bosch(博世)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对变分自动化任务无模型策略可靠性不足问题,提出图即策略多智能体编码框架GaP,通过生成计算图并行迭代优化,在虚实8项基准上表现远超基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04610 2026-07-07 cs.RO 新提交 67%

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications

RoboVista:评估用于各种机器人应用的视觉语言模型

Shuangyu Xie, Kaiyuan Chen, Ziyang Chen, Simeon Adebola, Yixuan Huang, Zehan Ma, Tianshuang Qiu, Wentao Yuan, Dhruv Shah, Pannag R. Sanketi, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 研究针对机器人多样应用,提出模块化评估框架Robot Question Answering及基准RoboVista,其源于真实机器人系统等,含多任务类型VQA实例,实验表明现有视觉语言模型有差距,且与现实任务执行相关。

Comments Accepted to RSS 2026. Project website: https://berkeleyautomation.github.io/robovista/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19954 2026-07-07 cs.AI cs.CL cs.LG 版本更新 67%

On the Ability of Transformers to Verify Plans

Transformer 在验证计划能力上的表现

Yash Sarrof, Yupei Du, Katharina Stein, Alexander Koller, Sylvie Thiébaux, Michael Hahn

机构 * Saarland University(萨尔兰大学) Australian National University(澳大利亚国立大学) University of Toulouse / LAAS-CNRS(图卢兹大学 / LAAS-CNRS)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究分析了解码器-only模型验证计划的能力,提出C*-RASP框架以保证序列长度和词汇量增长时的泛化能力,发现某些经典规划领域中Transformer能有效学习验证长计划。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06628 2026-07-07 cs.RO cs.CV 版本更新 67%

MIND-V: Hierarchical World Model for Long-Horizon Robotic Manipulation with RL-based Physical Alignment

MIND-V:基于强化学习物理对齐的长期机器人操作分层世界模型

Ruicheng Zhang, Mingyang Zhang, Jun Zhou, Xiaofan Liu, Zunnan Xu, Zhizhou Zhong, Puxin Yan, Haocheng Luo, Xiu Li

机构 * Tsinghua University(清华大学) X Square Robot(X Square机器人) Sun Yat-sen University(中山大学) HKUST(香港科技大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出MIND-V分层世界模型,通过语义推理、行为语义桥接和运动视频生成,结合强化学习物理对齐,实现长期机器人操作视频的物理合理合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06941 2026-07-07 cs.LG cs.AI cs.CL 版本更新 67%

Endogenous Resistance to Activation Steering in Language Models

语言模型中激活引导的内生抵抗

Alex McKenzie, Keenan Pepper, Stijn Servaes, Martin Leitgab, Murat Cubuktepe, Mike Vaiana, Diogo de Lucena, Judd Rosenblatt, Michael S. A. Graziano

机构 * University of Washington(华盛顿大学)

专题命中 规划推理 :self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现大型语言模型在任务不匹配的激活引导下能内生抵抗,通过显式重启恢复正确生成,并识别出相关稀疏自编码器潜在变量,可增强或削弱该抵抗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02811 2026-07-03 cs.NI cs.SY eess.SY 版本更新 67%

Tool Use as Action: Towards Agentic Control in Mobile Core Networks

工具使用作为行动:迈向移动核心网络中的智能体控制

Purna Sai Garigipati, Onur Ayan, Kishor Chandra Joshi, Xueli An

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出基于智能体AI的移动核心网络工具接口设计与原型,利用MCP和A2A协议实现意图驱动任务,并分析端到端延迟。

Comments Accepted for presentation at IEEE PIMRC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01972 2026-07-03 cs.CL cs.AI cs.LG 新提交 67%

Object Aligner: A Configurable JSON Schema Similarity Score for Graphs, Applied to LLM Prompt Optimization

Object Aligner: 一种可配置的图结构JSON模式相似度评分,应用于LLM提示优化

Jan Drchal

机构 * Artificial Intelligence Center, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院人工智能中心)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Object Aligner,一种基于递归树对齐和引用对齐的JSON相似度评分方法,通过Weisfeiler-Leman颜色细化近似图同构,用于LLM输出评估和提示优化。

Comments 28 pages, This is a submitted version of a manuscript under review at IEEE Access; it has not been peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00537 2026-07-02 eess.SP 新提交 67%

B2X Networks: Joint Design of Communication and Control for Embodied Intelligence

B2X网络:具身智能的通信与控制联合设计

Yuanwei Liu, Xu Gan, Zhaolin Wang, Chongjun Ouyang, Hao Jiang, Zongyao Zhao, Kaibin Huang, Robert Schober

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出脑-体-万物(B2X)网络概念,通过分布式与集中式脑架构,重新设计上下行通信以平衡传输性能与控制质量,实现无线网络与具身智能的融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31543 2026-07-01 cs.AI cs.CL cs.LG 新提交 67%

Modality-Driven Search with Holistic Trace Judging for ARC-AGI-2

基于模态驱动与整体轨迹判断的ARC-AGI-2求解方法

Johan Land

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对抽象推理中候选轨迹选择难题,提出模态驱动搜索生成多样化候选,并结合整体判断模型在长上下文中联合比较所有轨迹,在ARC-AGI-2上以低成本达到72.9%准确率,超越前沿模型。

Comments 37 pages, 4 figures; source code available at AGI" target="_blank" rel="noopener">https://github.com/beetree/ARC-AGI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31504 2026-07-01 cs.CV 新提交 67%

SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search

SimpleSearch-VL:多模态智能深度搜索的简单配方

Ming Dai, Zhihong Lu, Jinjie Gu, Jiedong Zhuang, Yefeng Liu, Wankou Yang, Jian Wang, Chunhua Shen

机构 * Southeast University(东南大学) Ant Group(蚂蚁集团)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出SimpleSearch-VL框架,通过因子化自适应展开和证据验证推理提升多模态智能搜索的效率与可靠性,仅用少量数据即显著超越基线。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29182 2026-06-30 cs.AI cs.CL cs.LG 67%

Evidence-Informed LLM Beliefs for Continual Scientific Discovery

基于证据的LLM信念用于持续科学发现

Dhruv Agarwal, Reece Adamson, Andrew McCallum, Peter Clark, Ashish Sabharwal, Bodhisattwa Prasad Majumder

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对AutoDiscovery将惊奇视为静态量而人类惊奇是非平稳的问题,提出证据信息化的LLM信念,通过基于嵌入的检索增强生成更新先验,并修改搜索过程以避免虚假奖励,平均非平稳惊奇提高30.62%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20625 2026-06-23 cs.AI cs.CL cs.LG 新提交 67%

AlphaMemo: Structured Search-Process Memory for Self-Evolving Alpha Mining Agents

AlphaMemo: 用于自我进化的Alpha挖掘智能体的结构化搜索过程记忆

Hang Yu, Zifan Zheng, Jeff Z. Pan, Tongliang Liu, Zhiyong Wang, Fengxiang He

机构 * University of Sydney(悉尼大学) University of Edinburgh(爱丁堡大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AlphaMemo,一种具有结构化搜索过程记忆的自我进化Alpha挖掘智能体,通过记录编辑模式在特定父因子上下文中的成败证据,结合置信门控残差记忆和非对称否决控制,提升样本外表现和固定预算发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14475 2026-06-23 cs.CV 版本更新 67%

GeoVista: Visually Grounded Active Perception for Vision-Language Understanding of Ultra-High-Resolution Remote Sensing Images

GeoVista: 用于超高清遥感理解的视觉引导主动感知

Jiashun Zhu, Ronghao Fu, Jiasen Hu, Jing Huang, Nachuan Xing, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 GeoVista提出一种基于规划的主动感知框架,通过构建全局探索计划和分支式局部检查,实现超高清遥感图像的高效解读,提升全局上下文理解与证据聚合效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13672 2026-06-18 cs.RO 新提交 67%

WEAVER, Better, Faster, Longer: An Effective World Model for Robotic Manipulation

$\texttt{WEAVER}$:更好、更快、更长——一种有效的机器人操作世界模型

Arnav Kumar Jain, Yilin Wu, Jesse Farebrother, Gokul Swamy, Andrea Bajcsy

机构 * Mila - Québec AI Institute(Mila - 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Carnegie Mellon University(卡内基梅隆大学) McGill University(麦吉尔大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出WEAVER世界模型架构,通过流匹配损失训练多视图潜在预测,同时实现高保真度、长程一致性和高效推理,在机器人操作任务中显著提升策略评估、改进和测试时规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18242 2026-06-17 cs.CV 新提交 67%

EventDrive: Event Cameras for Vision-Language Driving Intelligence

EventDrive: 用于视觉-语言驾驶智能的事件相机

Dongyue Lu, Rong Li, Ao Liang, Lingdong Kong, Wei Yin, Lai Xing Ng, Benoit R. Cottereau, Camille Simon Chane, Wei Tsang Ooi

机构 * NUS(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) Horizon Robotics(地平线机器人) A*STAR, I2R(新加坡科技研究局,资讯通信研究院) IPAL, CNRS IRL 2955, Singapore(IPAL,法国国家科学研究中心国际联合实验室2955,新加坡) University Toulouse, CNRS, CerCo, Toulouse, France(图卢兹大学,法国国家科学研究中心,CerCo,法国图卢兹) ETIS UMR 8051, CY Cergy Paris University, ENSEA, CNRS, France(ETIS UMR 8051,CY塞尔吉-巴黎大学,ENSEA,法国国家科学研究中心,法国)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出EventDrive基准和模型套件,通过多时域事件金字塔和时域混合专家模块融合事件流与RGB帧,在感知、理解、预测和规划四维度提升驾驶推理性能。

Comments CVPR2026, 34 pages, 15 figures, 15 tables, project page: https://dylanorange.github.io/projects/eventdrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14989 2026-06-16 cs.MA 新提交 67%

Hierarchical Generative Agents for Simulating Sequential Human Behavior

用于模拟序列人类行为的层次化生成式智能体

Maria G. Mendoza, Lucas Waldburger, Jin Lee, Shankar Sastry

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出基于认知层次和人格驱动的生成式智能体框架,结合大语言模型和人类疏散数据,模拟灾害中序列决策行为。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29796 2026-06-16 cs.AI cs.CL cs.LG 版本更新 67%

SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search

SAAS:面向智能体搜索中过度搜索缓解的自我感知强化学习

Yunbo Tang, Chengyi Yang, Shiyu Liu, Zhishang Xiang, Zerui Chen, Qinggang Zhang, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SAAS强化学习框架,通过搜索边界建模、边界感知奖励和分阶段优化策略,使LLM智能体具备动态自我感知能力,在不降低准确率的前提下显著减少过度搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13497 2026-06-12 cs.RO cs.CV 新提交 67%

SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale

SPARC:来自机器人演示的可靠空间标注

Nils Blank, Paul Mattes, Maximilian Xiling Li, Jakub Suliga, Thomas Roth, Moritz Reuss, Pankhuri Vanjani, Rudolf Lioutikov

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) NVIDIA(英伟达) Robotics Institute Germany(德国机器人研究所)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出SPARC框架,利用机器人任务的时空结构生成可靠性评分,自动标注演示中的空间信息,减少噪声标签并保留更多有用样本,在物体定位基准上优于纯检测基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13049 2026-06-12 cs.RO 新提交 67%

Y-BotFrame: An Extensible Embodied Agent Framework for Quadruped Robot Assistants

Y-BotFrame:一种用于四足机器人助手的可扩展具身智能体框架

Luyao Zhang, Ke Li, Yuan Ding, Xulong Zhao, Guo Yu, Chengwei Yan, Fuyu Dong, Jiawei Hu, Di Wang, Nan Luo, Gang Liu, Quan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出Y-BotFrame框架,集成多模态感知与大语言模型认知核心,将自然语言指令映射为可执行任务单元,实现无遥控器的人机协作,支持模块化扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10651 2026-06-10 cs.CV 新提交 67%

Kwai Keye-VL-2.0 Technical Report

Kwai Keye-VL-2.0 技术报告

Kwai Keye Team, Bin Wen, Changyi Liu, Chengru Song, Chongling Rao, Guowang Zhang, Han Li, Haonan Fan, Hengrui Ju, Jiankang Chen, Jiapeng Chen, Jiawei Yuan, Kaixuan Yang, Kaiyu Jiang, Kun Gai, Lingzhi Zhou, Na Nie, Sen Na, Tianke Zhang, Tingting Gao, Xuanyu Zheng, Yulong Chen, Fan Yang, Haixuan Gao, Lele Yang, Mingqiao Liu, Muxi Diao, Qi Zhang, Qile Su, Wei Chen, Wentao Hong, Xingyu Lu, Yancheng Long, Yankai Yang, Yingxin Li, Yiyang Fan, Yu Xia, Yuzhe Chen, Ziliang Lai, Chuan Yi, Haonan Jia, Tianming Liang, Weixin Xu, Xiaoxiao Ma, Yang Tian, Yufei Han, Feng Han, Hang Li, Jing Wang, Jinghui Jia, Junmin Chen, Junyu Shi, Ruilin Zhang

机构 * Kuaishou Group(快手集团)

专题命中 规划推理 :reasoning(abstract);self-correction(abstract)

AI总结 提出开源MoE多模态基础模型Keye-VL-2.0,首次将DeepSeek稀疏注意力适配到GQA架构,支持无损256K上下文处理,并通过跨模态多教师策略蒸馏和上下文/视频强化学习解决多任务对齐中的灾难性遗忘,在长视频理解和智能体任务上达到同类最优。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05645 2026-06-10 cs.RO 版本更新 67%

Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning

Discrete-WAM:面向世界-策略学习的统一离散视觉-动作标记编辑

Ziyang Yao, Haochen Liu, Yuncheng Jiang, Zeyu Zhu, Zibin Guo, Jingru Wang, Tianle Liu, Jianwei Cui, Kuiyuan Yang, Hongwei Xie, Jingwei Zhao, Guang Chen, Hangjun Ye

机构 * Xiaomi EV(小米电动车)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出Discrete-WAM,通过将未来视觉状态和自车动作对齐为离散标记,构建统一离散扩散框架,实现世界建模、世界-动作策略和分层决策策略的联合学习,支持可控生成和反事实推理,提升自动驾驶决策可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07831 2026-06-09 cs.SE 新提交 67%

SLRMentor: An LLM-Based Tool Supporting Learning of SLR in Software Engineering

SLRMentor:一种基于LLM的软件工程系统文献综述学习支持工具

Rodolfo Gil-Pereira, Ronnie de Souza Santos, Cleyton Magalahes, Italo Santos

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出SLRMentor对话助手,利用LLM支持软件工程中系统文献综述的学习与规划,通过引导搜索字符串构建和纳入排除标准推理,降低新手入门门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07723 2026-06-09 cs.RO 新提交 67%

VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation

VoLo: 面向开放词汇长时程操控的物理编排器

Siyi Chen, Hugo Hadfield, Alex Zook, Mikaela Angelina Uy, Chan Hee Song, Erwin Coumans, Xuning Yang, Faisal Ladhak, Qing Qu, Stan Birchfield, Jonathan Tremblay, Valts Blukis

机构 * NVIDIA(英伟达) University of Michigan(密歇根大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出VoLoAgent,利用VLM将VLA/WAM作为可中断工具进行物理编排,实现开放词汇长时程操控,并在新基准RoboVoLo上显著优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22238 2026-06-09 cs.RO 版本更新 67%

CodeGraphVLP: Code-as-Planner Meets Semantic-Graph State for Non-Markovian Vision-Language-Action Models

CodeGraphVLP:代码规划器与语义图状态的结合用于非马尔可夫视觉-语言-动作模型

Khoa Vo, Sieu Tran, Taisei Hanyu, Yuki Ikebe, Duy Nguyen, Nghi D. Q. Bui, Minh Vu, Anthony Gunderman, Chase Rainwater, Anh Nguyen, Ngan Le

机构 * University of Arkansas(亚拉巴马大学) Max Planck Research School for Intelligent Systems and the University of Stuttgart(马克斯·普朗克智能系统研究学校和斯图加特大学) Center of AI Research, VinUniversity(Vin大学人工智能研究中心) TU Wien(维也纳技术大学) University of Liverpool(利物浦大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 CodeGraphVLP结合语义图状态与可执行代码规划器,提升非马尔可夫长周期任务的视觉语言动作执行效率,降低规划延迟并提高任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00225 2026-06-08 cs.LG cs.AI cs.CL 版本更新 67%

Should You Use Your Large Language Model to Explore or Exploit?

你应该使用你的大语言模型进行探索还是利用?

Keegan Harris, Aleksandrs Slivkins

机构 * UC Berkeley(伯克利大学) Microsoft Research(微软研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究当前大语言模型在探索-利用权衡中的决策能力,通过分离探索和利用任务评估其表现,发现推理模型在利用任务上最有潜力但成本高,非推理模型通过工具使用和上下文总结可提升中等难度任务性能,但在所有任务中均不如简单线性回归,然而LLM在具有语义的大动作空间探索中有帮助。

Comments Accepted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14380 2026-06-08 cs.RO 版本更新 67%

CRAFT: Coaching Reinforcement Learning Autonomously using Foundation Models for Multi-Robot Coordination Tasks

CRAFT:利用基础模型自主教练强化学习以完成多机器人协调任务

Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

机构 * Department of Mechanical Engineering, University of California Berkeley(机械工程系,加州大学伯克利分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出CRAFT框架,利用大语言模型分解任务、生成奖励函数,并通过视觉语言模型优化,实现多机器人协调学习,在四足导航和双臂操作任务中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05567 2026-06-05 cs.CR cs.MA 67%

ZERO-APT: A Closed-Loop Adversarial Framework for LLM-Driven Automated Penetration Testing under Intelligent Defense

ZERO-APT: 智能防御下LLM驱动的自动化渗透测试的闭环对抗框架

Anlan Zheng, Tiantian Zhu

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出ZERO-APT框架,通过集成可配置的LLM防御者、架构级因果一致性机制和专用裁判智能体,解决了LLM驱动渗透测试在真实性、一致性和可审计性方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05414 2026-06-05 cs.CL cs.AI cs.HC cs.LG 67%

When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories

当证据稀疏时:对话和LLM-Agent轨迹中的弱监督早期失败预警

Avinash Baidya, Xinran Liang, Ruocheng Guo, Xiang Gao, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究院) Princeton University(普林斯顿大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对对话和LLM-Agent轨迹中早期失败预警问题,提出一种两阶段方法,通过注意力机制从稀疏的轨迹级标签中学习回合级失败证据,并结合α-STOP策略实现可控的早期预警,在多个基准上显著提升帕累托前沿质量并降低训练成本。

Comments 9 pages, 14 figures, and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09574 2026-06-05 cs.CL cs.AI cs.LG 67%

Aligning Tree-Search Policies with Fixed Token Budgets in Test-Time Scaling of LLMs

在LLMs的测试时间扩展中对树搜索策略与固定令牌预算对齐

Sora Miyamoto, Daisuke Oba, Naoaki Okazaki

机构 * University of Tokyo(东京大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种名为Budget-Guided MCTS (BG-MCTS)的树搜索解码算法,通过将搜索策略与剩余令牌预算对齐,以提高在不同令牌预算下的推理性能。

Comments Accepted at ICML 2026. Code: https://github.com/Sora-Miyamoto/bg-mcts

详情

展开后加载摘要…

URL PDF HTML 收藏