arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-31 至 2026-08-31 共收录 61 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 8 篇

2608.26747 2026-08-31 cs.AI 版本更新 87%

AgentFold: Closed-Loop Agentic Search for Protein Folding Model Design

AgentFold:用于蛋白质折叠模型设计的闭环智能体搜索

Mingquan Liu, Jiangyu Chen, Hanqun Cao, Xujun Zhang, Pengsen Ma, Xiangru Tang, Shuting Jin, Zhuo Yang, Annie Zheng, Tianfan Fu, Fang Wu, Xiangxiang Zeng

机构 * Hunan University(湖南大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Yale University(耶鲁大学) Wuhan University of Science and Technology(武汉科技大学) Southeast University(东南大学) Stanford University(斯坦福大学)

专题命中 工具调用 :agentic(title);agent(abstract);tool use(abstract);planning(abstract)

AI总结 AgentFold是将蛋白质折叠模型开发转化为闭环搜索的多智能体框架,以ESMFold为起点,通过MCTS策略分配计算资源,在匹配预算下较Codex提案提升lDDT 7.5%,优于随机搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22697 2026-08-31 cs.AI econ.GN 版本更新 85%

Does Rank Still Matter? Position Bias When AI Agents Shop on Our Behalf

排名仍然重要吗?AI代理代人购物时的位置偏差

Davood Wadi, Yu Ma

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究对比四种大语言模型与人类实地数据,发现AI代理代人购物时搜索深度更高、从不弃权,列表位置对其查看影响弱且非单调,结果属性比位置更重要,最终所有模型均选相同非劣势列表。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02751 2026-08-31 cs.IR cs.AI cs.CL 版本更新 73%

Search, Inspect, Fetch: Exploiting Structure-Aware Boolean Retrieval for Deep-Search Agents

搜索、检查、获取:利用布尔检索构建深度研究智能体

Shuai Wang, Haodong Chen, Yu Yin, Shengyao Zhuang, Bevan Koopman, Guido Zuccon

机构 * The University of Queensland(昆士兰大学) CSIRO(联邦科学与工业研究组织)

专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对现有深度研究智能体的缺陷,提出基于BQL的SIEVE接口,在三个问答数据集上实现更高准确率且token用量显著减少,验证了BQL过滤的有效性。

Comments clean up text, format, clearer setup;

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04935 2026-08-31 cs.SE cs.AI 版本更新 73%

ASA: Backbone-Training-Free Representation Engineering for Tool-Calling Agents

ASA:无需骨干训练的工具调用智能体表示工程

Youjin Wang, Run Zhou, Yingjie Ma, Rong Fu, Jiani Liang, Shuaishuai Cao, Min Huang, Tao Fang, Liangming Pan

机构 * Renmin University of China(中国人民大学) University of Macau(澳门大学) Central South University(中南大学) Jiangxi Normal University(江西师范大学) Macau Millennium College(澳门 millennium 学院) Peking University(北京大学)

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 针对大语言模型在工具调用中的惰性代理问题,提出一种无需训练、推理时激活干预的方法ASA,通过路由条件混合引导向量和探针引导门控,显著提升工具使用F1并降低误报率。

Comments Due to an unresolved dispute among the authors regarding the correctness of the experimental results and the validity of the conclusions, the team has decided to withdraw this paper until these issues can be fully resolved

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18414 2026-08-31 cs.CR cs.AI 版本更新 70%

Prompts Don't Protect: Architectural Enforcement via MCP Proxy for LLM Tool Access Control

提示不保护:通过MCP代理实现的架构强制以实现LLM工具访问控制

Rohith Uppala

机构 * Independent Researcher(独立研究员)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出了一种受控的MCP代理,通过在工具发现和工具调用两个阶段实施基于属性的访问控制(ABAC),有效阻止了未经授权的工具调用,而提示基于的限制仅能减少11-18个百分点的未授权调用率,证明了架构强制在部署的智能体系统中实现可靠工具访问控制的必要性。

Comments 7 pages, 4 tables, 2 figures. Camera-ready version accepted to the EMNLP 2026 Industry Track; adds benign-utility and abstention evaluation, latency percentiles, and revised limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19423 2026-08-31 cs.CR cs.AI cs.LG 版本更新 62%

The Autonomy Tax: Defense Training Breaks LLM Agents

自主性税:防御训练破坏LLM智能体

Shawn Li, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 揭示防御训练在提升LLM智能体安全性时,系统性地破坏其工具执行能力,导致任务失败率飙升,且无法有效防御复杂攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24024 2026-08-31 cs.AI 版本更新 57%

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放

Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

机构 * University of Southern California(南加州大学) Pohang University of Science and Technology (POSTECH)(浦项科技大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对多轮搜索智能体中基于置信度投票因复制膨胀失效的问题,提出检索接地投票(RGV)方法,在四个基准和五个 LLM 上性能优于基线,准确率最高提升 5.4%

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02009 2026-08-31 cs.AI 版本更新 57%

HALT: Verification-Aware Stopping for Retrieval-Augmented Search Agents

HALT:面向检索增强搜索智能体的感知验证式停止策略

Daeyoung Roh, Donghee Han

机构 * KAIST(韩国科学技术院)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究针对检索增强搜索智能体的冗余检索问题,提出轻量级感知验证停止策略HALT,在三个多跳QA基准上减少冗余搜索且保持精确匹配,无需修改宿主智能体。

Comments Accepted to Findings of EMNLP 2026. 23 pages, 6 figures. Code: this https URL (https://github.com/Noverse0/HALT)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 25 篇

2608.26086 2026-08-31 cs.LG cs.AI 版本更新 88%

TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning Development

TraceML:机器学习开发中人类-智能体规划的实证分析

Jiarui Yan, Weiwei Sun, Sijie Li, Wenhan Li, Yiming Yang

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);分类 cs.AI、cs.LG

AI总结 TraceML通过构建人类与智能体在Kaggle竞赛中的配对轨迹数据集,实证分析了人类与智能体在机器学习开发规划上的差异,发现智能体存在行为循环问题,提炼的人类规划提示可缩小部分差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05614 2026-08-31 cs.AI 版本更新 85%

Real-Time AI Service Economy: A Framework for Agentic Computing Across the Continuum

实时AI服务经济:跨连续体的代理计算框架

Lauri Lovén, Alaa Saleh, Reza Farahani, Ilir Murturi, Miguel Bordallo López, Praveen Kumar Donta, Schahram Dustdar

机构 * Future Computing Group, University of Oulu(奥卢大学未来计算组) Department of Information Technology (ITEC), University of Klagenfurt(克雷夫特大学信息科技学院) Department of Mechatronics, University of Prishtina(普里什蒂纳大学机电学院) Multimodal Sensing Lab, University of Oulu(奥卢大学多模态感知实验室) Department of Computer and Systems Sciences, Stockholm University(斯德哥尔摩大学计算机与系统科学系) ICREA Barcelona, Spain and the Distributed Systems Group, TU Wien(巴塞罗那ICREA和维也纳技术大学分布式系统组)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出了一种混合架构,通过封装复杂子图到资源切片,解决实时AI服务在设备-边缘-云连续体上的资源分配问题,验证了依赖图拓扑对价格稳定性和系统性能的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30434 2026-08-31 cs.LG cs.AI cs.CL cs.MA 版本更新 85%

LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis

LongDS-Bench:关于长周期智能数据分析的失败

Kewei Xu, Xiaoben Lu, Shuofei Qiao, Zihan Ding, Haoming Xu, Lei Liang, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出LongDS基准,用于评估长周期多轮数据分析中智能体维护和更新分析状态的能力,发现最佳模型平均准确率仅48.45%,且长周期错误占失败原因的52%-69%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01335 2026-08-31 cs.CV cs.AI 版本更新 83%

Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning

超越像素:通过基于模式的代理推理实现视觉隐喻转移

Yu Xu, Yuxin Zhang, Lin Gao, Oliver Deussen, Tong-Yee Lee, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文脉) University of Konstanz(康斯坦茨大学) National Cheng-Kung University(国立成功大学)

专题命中 规划决策 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于模式的代理推理框架,实现视觉隐喻转移,通过多代理协作提升隐喻生成的抽象逻辑与视觉创造力。

Comments Accepted to SIGGRAPH ASIA 2026; Project page: this https URL (https://yuci-gpt.github.io/Beyond-Pixels/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00422 2026-08-31 cs.CR 版本更新 82%

KidnapRAG: A Black-Box Attack for Hijacking Reasoning in Agentic Retrieval-Augmented Generation Systems

KidnapRAG:针对代理式检索增强生成系统中推理劫持的黑盒攻击

Chanwoo Choi, Euntae Kim, Kyuho Lee, Youngsam Chun, Jinhee Jeong, Eunmi Kim, Myunggyo Oh, Junseo Jang, Buru Chang

专题命中 规划决策 :agentic(title,abstract);agent(abstract)

AI总结 提出KidnapRAG,一种针对代理式RAG系统的黑盒顺序投毒攻击,通过三种角色文档(诱饵、链环、恶意指令)劫持多步推理链,实验表明在多种框架和基准上优于现有方法。

Comments Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01113 2026-08-31 cs.RO 版本更新 82%

From Dialogue to Execution: Mixture-of-Agents Assisted Interactive Planning for Behavior Tree-Based Long-Horizon Robot Execution

从对话到执行:基于混合代理的交互式规划用于基于行为树的长时域机器人执行

Kanata Suzuki, Kazuki Hori, Haruka Miyoshi, Shuhei Kurita, Tetsuya Ogata

机构 * Waseda University(早稻田大学) National Institute of Informatics(国家信息研究所) NII Research and Development Center for Large Language Models(国家信息研究所大型语言模型研究开发中心) The Graduate University for Advanced Studies (SOKENDAI)(高级研究大学研究生院(SOKENDAI))

专题命中 规划决策 :planning(title,abstract);agent(abstract)

AI总结 本文提出基于混合代理的交互式规划框架,通过生成行为树实现长时域机器人任务的高效执行,减少人类干预并提升执行质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12831 2026-08-31 cs.RO eess.SY 版本更新 82%

SIMPNet: Spatial-Informed Motion Planning Network

SIMPNet:空间感知运动规划网络

Davood Soleymanzadeh, Xiao Liang, Minghui Zheng

专题命中 规划决策 :planning(title,abstract)

AI总结 针对现有基于采样的运动规划器在高维空间及复杂环境中效率低的问题,提出SIMPNet,其通过GNN与交叉注意力机制生成知情采样,经UR5e评估,性能优于基准规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18682 2026-08-31 cs.AI 版本更新 79%

RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

RTPO:用于稳定智能体强化学习训练的反向回合策略优化

Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu

机构 * Adelaide University(阿德莱德大学) The University of Sydney(悉尼大学) Curtin University(科廷大学) School of CSIT(计算机科学与信息技术学院) ACFR(澳大利亚空间研究中心) School of EECMS(电子工程、计算机与数学科学学院)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 针对多回合智能体RL训练不稳定问题,提出RTPO方法,通过反向回合策略优化消除上下文不匹配与异步漂移,实验显示其较基线提升21.50%、10.76%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22713 2026-08-31 cs.AI 版本更新 79%

SEGRA: A Structured Experience Guided Reasoning Agent for Property Graph Question Answering

SEGRA:用于基于Gremlin的问答的结构化经验引导图推理代理

Saiyue Lyu, Mariam Dundua, Vishaal Kapoor, Sarthak Ahuja, Neda Kordjazi, Evren Yortucboylu, Harsh Amin, Rebecca Steinert

机构 * University of British Columbia(英属哥伦比亚大学) Amazon(亚马逊)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 针对企业文本到Gremlin问答难题,SEGRA引入经验引导代理,集成多种技术,包括意图路由、查询生成等。在企业IT支持基准测试中成绩出色,平均评判分数大幅提高,技能库还降低了成本,提升了企业图问答的准确性与效率。

Comments Accepted at EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19881 2026-08-31 q-bio.NC 版本更新 78%

Planning difficulty and temporal constraints differently shape the level of detail and ordering of visual exploration

问题难度和等待时间影响人类规划中视觉策略的细节和时间组织水平

Mattia Eluchans, Giovanni Pezzulo

专题命中 规划决策 :planning(title,abstract)

AI总结 研究探讨了问题难度和等待时间如何影响人类规划中视觉策略的细节和时间组织,发现难度增加视觉覆盖,时间影响执行中的重计划程度和目光路径一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11072 2026-08-31 cs.RO math.OC 版本更新 78%

Receding Fixed-Horizon Optimization for Near-Time-Optimal Trajectory Planning and Control

后退固定时域优化用于近时间最优轨迹规划与控制

Haotian Tan, Yuan-Hua Ni

机构 * College of Artificial Intelligence, Nankai University, Tianjin 300350, PR China(人工智能学院,南开大学,天津)

专题命中 规划决策 :planning(title,abstract)

AI总结 针对自动驾驶车辆时间最优轨迹规划的两大挑战,提出分层凸优化框架,分解问题为短固定时域规划循环,实验显示其成功率更高、计算时间更短,可实现可靠实时近时间最优轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30105 2026-08-31 cs.SE 版本更新 77%

EvoRepair: Enhancing Vulnerability Repair Agents Through Experience-Based Self-Evolution

EvoRepair: 通过基于经验的自我进化增强漏洞修复智能体

Haichuan Hu, Guoqing Xie, Quanjun Zhang, Jiawei Liu, Shengcheng Yu, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 规划决策 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.SE

AI总结 提出EvoRepair框架,通过循环学习-修复过程积累和复用漏洞修复经验,在多个基准上显著提升LLM的自动漏洞修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19151 2026-08-31 cs.AI cs.MA 版本更新 77%

Multimodal Collaborative Debate for Zero-Shot Time Series Reasoning

TS-Debate:多模态协作辩论用于零样本时间序列推理

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST Seoul(韩国科学技术院)

专题命中 规划决策 :agent(abstract);tool use(abstract);multi-agent(abstract);分类 cs.AI

AI总结 TS-Debate通过多模态协作辩论框架,在零样本时间序列推理中实现显著性能提升,通过专门代理和结构化协议提升模态保真度和数值精度。

Comments EMNLP 2026 (Main), Project Page: this https URL (https://deepauto-ai.github.io/ts-debate/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22538 2026-08-31 cs.AI 版本更新 74%

STAGE: Stateful Translation to Agentic Graph Execution with Policy-Scoped Context and Deterministic Control

STAGE:基于策略范围上下文与确定性控制的面向智能体图执行的有状态翻译

Mengxi Luo, Changjia Chen, An Cao, Zirong Huang, Wanyi Dai

专题命中 规划决策 :agentic(title);分类 cs.AI

AI总结 该研究提出可执行图框架\textsc{Stage},将模型判断限缩于策略范围节点、流程控制交由确定性代码,在多基准测试中提升了策略执行的任务成功率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23149 2026-08-31 cs.AI 版本更新 74%

Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models

描述-然后-行动:通过蒸馏的语言-动作世界模型实现前瞻性智能体导航

Massimiliano Pappa, Luca Romani, Valentino Sacco, Alessio Palma, Stéphane Lathuilière, Fabio Galasso, Xavier Alameda-Pineda, Indro Spinelli

机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) Inria, Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化技术研究所)

专题命中 规划决策 :agent(title);分类 cs.AI

AI总结 本文提出DILLO模型,通过蒸馏方法实现无需视觉模拟的前瞻性智能体导航,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20409 2026-08-31 cs.CL cs.AI cs.CY 版本更新 73%

Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations

认知链式推理(CoCoT):关于社会情境的结构化多模态推理

Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

机构 * Seoul National University(首尔国立大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出CoCoT框架,通过感知、情境推断和规范应用三个阶段提升多模态社会推理能力,在多个任务中取得显著提升。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00864 2026-08-31 math.OC 版本更新 71%

BattOpt: Optimal Facility Planning for Electric Vehicle Battery Recycling

BattOpt:电动汽车电池回收的最优设施规划

Matthew Brun, Xu Andy Sun

专题命中 规划决策 :planning(title)

AI总结 本文提出多阶段随机优化模型,将EverBatt转化为决策工具,结合计量经济学预测生成场景,得出最优电池回收投资可降22%制造成本、26%环境影响,算法求解速度提升14倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23629 2026-08-31 cs.RO cs.AI 版本更新 70%

Macro-Operator Generation and Predicate Selection for TAMP Operator Learning

TAMP算子学习的宏算子生成与谓词选择

Can Emir Bora, Emre Ugur

机构 * Bogazici University(博加齐奇大学)

专题命中 规划决策 :planning(abstract,abstract_cn);分类 cs.AI

AI总结 本文针对TAMP算子学习的效率问题,提出自动生成宏算子并剪枝未被引用谓词的系统,在四个TAMP领域实现最高4.6倍规划加速,还解决了基线无法处理的长序列任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13396 2026-08-31 cs.AI cs.CL cs.SE 版本更新 69%

Set-shifting Behavioral Test for Harnessed Agents

用于受约束智能体的集合转移行为测试

Ye Ziwei

专题命中 规划决策 :agent(abstract,comments);分类 cs.AI、cs.CL、cs.SE

AI总结 研究当可靠工具在会话中悄然改变时语言模型智能体的工具选择,借鉴认知心理学的集合转移构建基准和评估框架,计算集合转移准确率,测试发现不同失败模式及集合框架对路由动态有影响。

Comments Accepted at COLM 2026 Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10696 2026-08-31 stat.ML cs.LG math.OC math.ST 版本更新 57%

Robust Assortment Optimization from Observational Data

从观测数据中稳健的 assortment 优化

Miao Lu, Yuxuan Han, Han Zhong, Zhengyuan Zhou, Jose Blanchet

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出了一种稳健的数据驱动 assortments 优化框架,通过考虑客户选择行为的潜在分布变化,实现了样本高效且稳健的 assortments 学习。

Comments 65 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16425 2026-08-31 cs.LG 版本更新 57%

Bayesian Experimental Design for Model Discrepancy Calibration: A Rivalry between Kullback--Leibler Divergence and Wasserstein Distance

贝叶斯实验设计用于模型偏差校准:KL散度与瓦瑟斯坦距离的较量

Huchen Yang, Xinghao Dong, Jin-Long Wu

机构 * Department of Mechanical Engineering, University of Wisconsin–Madison, Madison, WI 53706(机械工程系,威斯康星大学麦迪逊分校,麦迪逊,WI 53706)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文比较了KL散度与瓦瑟斯坦距离在贝叶斯实验设计中的应用,发现KL散度在无模型偏差时收敛更快,而瓦瑟斯坦距离在存在模型偏差时更稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23607 2026-08-31 cs.CV cs.RO 版本更新 50%

Reasoning models do not yet follow their reasoning in autonomous driving: The KITScenes LongTail Dataset

长尾驾驶场景与推理轨迹:KITScenes长尾数据集

Royden Wagner, Omer Sahin Tas, Jaime Villa, Felix Hauser, Yinzhe Shen, Marlon Steiner, Dominik Strutz, Carlos Fernandez, Quentin Delfosse, Christoph Weinhuber, Christian Kinzig, Guillermo S. Gutierrez-Cabello, Hendrik Königshof, Fabian Immel, Richard Schwarzkopf, Nils Alexander Rack, Kevin Rösch, Kaiwen Wang, Jan-Hendrik Pauls, Martin Lauer, Igor Gilitschenski, Holger Caesar, Christoph Stiller

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) FZI Research Center for Information Technology(FZI信息技术研究中心) University Charles III of Madrid(马德里卡洛斯三世大学) Technical University of Madrid(马德里理工大学) University of Toronto(多伦多大学) Delft University of Technology(代尔夫特理工大学)

专题命中 规划决策 :planning(abstract)

AI总结 本文提出KITScenes长尾数据集,通过多视角视频、轨迹、指令和推理轨迹提升模型在长尾驾驶场景下的泛化能力,评估指令遵循与语义连贯性。

Comments 27 pages; v2: update MMS values (bugfix); v3: more focus on reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏