arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 7434 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 2137 篇

2607.13354 2026-07-16 cs.RO 新提交 75%

A Hybrid Sampling-Based Trajectory Planner with Game-Theoretic Guidance for Autonomous Racing

一种基于混合采样的具有博弈论引导的自主赛车轨迹规划器

Alexander Langmann, Frederico Pita de Araujo, Mattia Piccinini, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, TUM School of Engineering and Design, Technical University of Munich(慕尼黑工业大学工程与设计学院自动驾驶车辆系统教授组) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所)

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 针对自主赛车在多智能体场景下的规划问题,提出将博弈论推理集成到基于采样的运动规划器的混合架构,利用离线学习势函数和在线梯度优化生成交互参考路径,在模拟环境中验证该方法能诱导防御行为且无计算负担。

Comments Accepted to IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11388 2026-07-14 cs.AI cs.CL cs.LG cs.MA 新提交 75%

StructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure

StructAgent:利用统一因果结构驾驭长时程数字智能体

Wenyi Wu, Sibo Zhu, Kun Zhou, Aayush Salvi, Zixuan Song, Biwei Huang

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) Aether AI Lab(以太人工智能实验室)

专题命中 规划决策 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对长时程任务中智能体任务进展难解释、验证和恢复的问题,提出StructAgent框架,通过统一因果结构维护任务进展并规范工作流程,实验证明其能提升多种模型性能且具有通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08093 2026-07-10 cs.AI cs.CL cs.LG 新提交 75%

CausalDS: Benchmarking Causal Reasoning in Data-Science Agents

因果DS:数据科学智能体中的因果推理基准测试

Andrej Leban, Yuekai Sun

机构 * Department of Statistics University of Michigan(统计学系密歇根大学)

专题命中 规划决策 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 介绍用于评估数据科学智能体因果推理的CausalDS基准,由含观测数据的结构因果模型和合成自然语言故事构成场景,导出跨越Pearl三个层级的任务,联合评估符号因果推理、数据科学等多方面能力。

Comments 55 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23997 2026-06-24 cs.IR 新提交 75%

ChartWalker: Benchmarking the Cross-Chart RAG Task with Hierarchical Knowledge Graphs

ChartWalker: 跨图表RAG任务的基准测试

Ning Tang, Chenghan Xie, Hanyang Yuan, Yi Li, Renhong Huang, Qian Kou, Xiaofeng Shi, Hua Zhou, Jiarong Xu

专题命中 规划决策 :agent(abstract,abstract_cn);agentic(abstract)

AI总结 提出ChartWalker框架,通过层次化知识图谱和结构感知采样生成跨图表RAG基准,揭示现有方法性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20164 2026-06-19 cs.CL cs.AI cs.LG q-bio.QM 新提交 75%

MedRLM: Recursive Multimodal Health Intelligence for Long-Context Clinical Reasoning, Sensor-Guided Screening, Evidence-Grounded Decision Support, and Community-to-Tertiary Referral Optimization

MedRLM:用于长上下文临床推理、传感器引导筛查、证据支持决策及社区到三级转诊优化的递归多模态健康智能

Aueaphum Aueawatthanaphisut

机构 * School of Information, Computer Communication Technology Sirindhorn International Institute of Technology, Thammasat University Pathum Thani, Thailand 1

专题命中 规划决策 :planning(abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出MedRLM递归多模态健康智能框架,通过递归检查、分解、检索、验证和合成患者信息,协调多个专业代理并引入临床证据图记忆,实现长上下文临床推理和传感器引导筛查。

Comments 9 pages, 3 figures, 3 tables, 1 Algorithm, 29 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12195 2026-06-11 cs.CV 新提交 75%

InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning

InternVideo3: 用多模态上下文推理代理化基础模型

Ziang Yan, Sheng Xia, Jiashuo Yu, Yue Wu, Tianxiang Jiang, Songze Li, Kanghui Tian, Yicheng Xu, Yinan He, Kai Chen, Limin Wang, Yu Qiao, Yi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 规划决策 :agent(abstract);tool use(abstract);agentic(abstract)

AI总结 提出InternVideo3框架,通过多模态上下文推理(MCR)和高效KV缓存压缩方法M^2LA,增强长视频理解与迭代交互能力,在多个基准上取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11680 2026-06-11 cs.AI cs.CL cs.LG 新提交 75%

Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents

先组织再检索:面向高效智能体的层次化记忆导航

Hao-Lun Hsu, Nikki Lijing Kuang, Boyi Liu, Zhewei Yao, Yuxiong He

机构 * Duke University(杜克大学) Snowflake AI Research(Snowflake AI研究)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出HORMA框架,通过构建文件系统式的层次化记忆结构并利用强化学习训练的轻量级导航代理,实现高效检索,在长时任务中提升性能并降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07723 2026-06-09 cs.RO 新提交 75%

VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation

VoLo: 面向开放词汇长时程操控的物理编排器

Siyi Chen, Hugo Hadfield, Alex Zook, Mikaela Angelina Uy, Chan Hee Song, Erwin Coumans, Xuning Yang, Faisal Ladhak, Qing Qu, Stan Birchfield, Jonathan Tremblay, Valts Blukis

机构 * NVIDIA(英伟达) University of Michigan(密歇根大学)

专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract)

AI总结 提出VoLoAgent,利用VLM将VLA/WAM作为可中断工具进行物理编排,实现开放词汇长时程操控,并在新基准RoboVoLo上显著优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14149 2026-07-17 cs.AI cs.LG 新提交 74%

Enhancing Small Language Models Reasoning through Knowledge Graph Grounding

通过知识图谱基础增强小型语言模型推理

Dimitrios Kelesis, Konstantinos Bougiatiotis, Georgios Paliouras

机构 * Institute of Informatics and Telecommunications, National Center for Scientific Research “Demokritos(信息与电信研究所,国家科学研究中心“德谟克利特”)

专题命中 规划决策 :agentic(abstract,comments);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究利用神经符号智能框架增强小型语言模型推理能力,通过特定工具调用转变模型,在两种场景下评估,发现虽提示提升性能,但受提取瓶颈等限制,还存在“干扰效应”,刻画了挑战并提供迭代验证路线图。

Comments Presented at the 2nd Causal Neuro-symbolic Artificial Intelligence (Causal NeSy): Toward Agentic LLMs with Neuro-Symbolic and Graph Based Reasoning Workshop @ ESWC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13115 2026-07-16 cs.AI cs.LG 新提交 74%

Improving Molecular Property Prediction in Small Language Models Using Graph-based Tools

使用基于图的工具改进小语言模型中的分子性质预测

Konstantinos Bougiatiotis, Dimitrios Kelesis, Georgios Paliouras

机构 * Institute of Informatics and Telecommunications, National Center for Scientific Research “Demokritos(信息与电信研究所,国家科学研究中心“德谟克利特”)

专题命中 规划决策 :agentic(abstract,comments);tool use(abstract);分类 cs.AI、cs.LG

AI总结 研究针对小语言模型在分子性质预测时的结构盲目性问题,提出模块化上下文增强提示框架,通过GNN专家模型和提取子图来辅助预测,在MUTAG和Tox21数据集上实验表明该方法能显著提升预测准确性,验证了基序相关性,但与专门GNN模型仍有差距。

Comments Presented at the 2nd Causal Neuro-symbolic Artificial Intelligence (Causal NeSy): Toward Agentic LLMs with Neuro-Symbolic and Graph Based Reasoning Workshop @ ESWC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25518 2026-08-27 cs.AI 新提交 74%

Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

智能体游戏开发:用于扩展世界模型的可验证轨迹数据引擎

Pengfei Zhou, Hexin Wang, Zhengfeiyang Zhang, Yixing Ma, Zhenglin Wan, Kaipeng Zhang, Wangbo Zhao, Yang You

机构 * Cardinal AI Lab(卡迪纳尔人工智能实验室) University of California, Berkeley(加州大学伯克利分校) Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国立大学) HPC-AI Lab(高性能计算与人工智能实验室)

专题命中 规划决策 :agentic(title);分类 cs.AI

AI总结 本文指出扩展世界模型的传统策略效率低,提出将游戏开发作为可验证轨迹数据引擎,构建RLHEV后训练范式,为空间世界模型提供高质量奖励信号与长程轨迹数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25474 2026-08-27 cs.CR cs.SE 新提交 74%

Separating Disclosure from Authorization: Field-Tier Minimization for Agent Action Mediation

将授权与披露分离:面向智能体动作调解的字段层级最小化

Jiten Oswal, John Cadeddu

专题命中 规划决策 :agent(title);分类 cs.SE

AI总结 该研究提出智能体动作调解的字段层级最小化方法,将参数字段分为三类,实现授权与披露分离,解决事实计算方问题并分析泄露,保障账本安全与审计需求。

Comments 19 pages, 2 figures, 5 tables. Describes an implemented system in private pilot deployment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24037 2026-08-26 cs.CL 新提交 74%

Curved Inference II: Sleeper Agent Geometry - Extending Interpretability Beyond Probes

曲线推理 II:休眠智能体几何——将可解释性扩展至探测技术之外

Rob Manson

专题命中 规划决策 :agent(title);分类 cs.CL

AI总结 本文扩展了Anthropic的休眠智能体研究,提出曲线推理框架,引入语义表面积度量,通过多轮上下文窗口分析自然欺骗推理的几何特征,为线性检测失效时提供了可扩展的无监督检测路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22856 2026-08-25 cs.IR cs.CL 新提交 74%

Same Agent, Different Answers: A Repeat-Aware Audit of Corpus-Induced Answer Churn in Retrieval-Augmented QA

同一智能体,不同答案:对检索增强问答中语料库诱导的答案波动的感知重复审计

Jingjie Ning, Xueqi Li

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

专题命中 规划决策 :agent(title);分类 cs.CL

AI总结 该研究针对检索增强问答系统索引扩展后出现的答案波动现象,提出Snapshot Compatibility Audit方法,经Natural Questions、TriviaQA等数据集验证,发现存在无对应准确率变化的答案兼容性失效问题,建议检索增强发布需审计兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22676 2026-08-25 cs.AI 新提交 74%

Robustness Analysis of Agentic AI to Inconsistent and Incomplete Tool Responses

智能体人工智能对不一致和不完整工具响应的鲁棒性分析

Jiachen Xu, Torben Bach Pedersen, Zhongming Yao, Xiaoyu Zhang, Yushuai Li

机构 * Aalborg University(奥尔堡大学) Zhejiang University(浙江大学) Northeastern University(东北大学)

专题命中 规划决策 :agentic(title);分类 cs.AI

AI总结 该研究通过在零售客户服务领域注入受控故障,分析智能体AI对不一致、不完整工具响应的鲁棒性,发现两类响应在特定通道中可不对称识别,动作分布特征存在差异。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22538 2026-08-25 cs.AI 新提交 74%

STAGE: Stateful Translation to Agentic Graph Execution with Policy-Scoped Context and Deterministic Control

STAGE:基于策略范围上下文与确定性控制的面向智能体图执行的有状态翻译

Mengxi Luo, Changjia Chen, An Cao, Zirong Huang, Wanyi Dai

专题命中 规划决策 :agentic(title);分类 cs.AI

AI总结 该研究提出可执行图框架\textsc{Stage},将模型判断限缩于策略范围节点、流程控制交由确定性代码,在多基准测试中提升了策略执行的任务成功率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19794 2026-08-21 cs.AI cs.RO 新提交 74%

Towards general embodied intelligence: integrating large language models, knowledge bases, and reasoning capabilities to build the next generation of AI agents

迈向通用具身智能:整合大语言模型、知识库与推理能力以构建下一代AI智能体

Fujiang Yuan, Xia Huang, Lusheng Wang, Jun Ding, Zhen Tian, Yuxin Wang, Shaojie Gu, Yuki Funabora, Yanhong Peng, Zebing Mao

机构 * College of Mechanical Engineering, Chongqing University of Technology(重庆理工大学机械工程学院) James Watt School of Engineering, University of Glasgow(格拉斯哥大学詹姆斯·瓦特工程学院) School of Energy and Power, Jiangsu University of Science and Technology(江苏科技大学能源与动力学院) Magnesium Research Center, Kumamoto University(熊本大学镁研究中心) Department of Information and Communication Engineering, Nagoya University(名古屋大学信息与通信工程系) State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室)

专题命中 规划决策 :AI agent(title);分类 cs.AI

AI总结 本文综述以LLM为核心的智能系统演进,提出整合LLMs、KBs、RA与具身性的概念框架,明确高效LLM部署等五大挑战,为开发复杂动态环境下的自适应多模态智能体提供路线图。

Journal ref International Journal of Hydromechatronics 9(2) (2026) 250-316

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18746 2026-08-20 cs.LG cs.CV 新提交 74%

Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning

潜在世界模型中的决策度量对齐:MPC规划的诊断与动作条件目标

Jiawei Wang, Ke Rui, Yushen Zuo, Yichun Feng, Minglei Li

专题命中 规划决策 :planning(title);分类 cs.LG

AI总结 该研究针对潜在世界模型中MPC规划的决策度量对齐问题,提出两种秩一致性诊断指标,开发DA-LeWM模型,验证其可加快收敛并提升在线成功率,改善潜在MPC的几何结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16663 2026-08-18 cs.DB cs.AI 新提交 74%

Bounded Semantic Planning and Deterministic Compilation for Reliable Enterprise Text-to-SQL

用于可靠企业级文本到SQL的有界语义规划与确定性编译

Yi Ai

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 提出语义路径编译(SPC)系统,在ACME保险基准测试中,其文本到SQL任务正确率达97.4%,显著优于基线系统,且鲁棒性更强。

Comments 10 sections, 2 figures, 6 tables. Preprint. Code and research artifacts are described in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12915 2026-08-14 cs.DC cs.AI 新提交 74%

InFactPlanner: Planning Sustainable Geo-Distributed LLM Data Centers

InFactPlanner:可持续地理分布式大语言模型(LLM)数据中心规划

Nicoletta Tsiopani, Moysis Symeonides, George Pallis, Marios D. Dikaiakos

机构 * University of Cyprus(塞浦路斯大学)

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 InFactPlanner是用于LLM推理的可持续地理分布式数据中心部署假设分析的决策支持框架,可通过多维度建模分析得出可持续性与延迟最优选择存在差异等结论。

Comments Author copy of paper published at 34th International Symposium on the Modeling, Analysis, and Simulation of Computer and Telecommunication System (MASCOTS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10333 2026-08-12 cs.LG 新提交 74%

MERA: Model Evolution and Routing with Skill Adaptation for Agentic Systems at Scale

MERA:面向大规模智能体系统的技能适配型模型演化与路由

Yuhang Yao, Zeyu Wang, Wanyi Chen, Tongyun Yang, Yuhang Han, Jie Xiao, Chengke Bao, Tianyi Zhao, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 规划决策 :agentic(title);分类 cs.LG

AI总结 MERA以单模型调用为适应单元,通过多轮适配提升小模型能力,结合带验证器回退的成本校准路由,在HumanEval+MBPP、TAU-2等数据集上实现小模型性能提升与成本降低。

Comments Preliminary version in CAIS RL-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08640 2026-08-11 cs.AI 新提交 74%

SkillReason: Reasoning-Enhanced Agent Skill Retrieval for Implicit User Requests

SkillReason:面向隐式用户请求的推理增强型智能体技能检索

Donghong Jiang, Endian Lin, Luoping Cui, Hanqing Liu, Mingjie Liu, Fan Yang, Hong Wang, Zhao Yang, Chuang Zhu

专题命中 规划决策 :agent(title);分类 cs.AI

AI总结 针对隐式用户请求的技能检索难题,提出两阶段框架SkillReason,结合推理增强训练,在SkillReason-Bench等三个基准上取得最优性能,缩小任务目标与技能能力的语义差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08466 2026-08-11 cs.AI 新提交 74%

Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses

分层自改进:一种面向任务特定可进化智能体控制框架的方法

Tailin Zhou

机构 * HKUST(香港科技大学)

专题命中 规划决策 :agent(title);分类 cs.AI

AI总结 本研究提出HSI框架,使冻结LLM的任务特定控制框架可进化,在中等难度任务上取得性能提升,超出模型能力时无增益,为改进冻结LLM智能体提供可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04765 2026-08-06 cs.RO cs.AI cs.CV 新提交 74%

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models

用于视觉-语言-动作模型长程规划的显式语言记忆

Houze Xu, Jizhong Li, Ziyi Ye

机构 * Fudan University(复旦大学)

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 该研究针对视觉-语言-动作模型长程规划的挑战,提出带显式语言记忆模块的分层架构,经仿真与实机实验验证,可提升复杂长程任务的成功率、鲁棒性与决策可解释性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01837 2026-08-04 cs.AI 新提交 74%

PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning

PCSD:智能体强化学习中自蒸馏的持久一致性

Chunji Lv, Yangguang Wei, Junlin Liu, Yang Gao, Ming Liu, Xinming Wang, Jinyang Wu, Guoren Wang, Changsheng Li

专题命中 规划决策 :agentic(title);分类 cs.AI

AI总结 该研究针对智能体强化学习中奖励稀疏问题,提出PCSD方法,通过持久一致性推导蒸馏权重,结合GRPO优化,在ALFWorld等基准上取得优于GRPO、SDAR的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28647 2026-08-03 cs.HC cs.AI 新提交 74%

ConnectED: A Curriculum-Aligned AI System for Vietnamese Instructional Lesson Planning and Student Learning

ConnectED:面向越南教学课程规划与学生学习的课程对齐AI系统

Thang Doan Viet, Anh Nguyen Hoang, Tinh Luong Son, Anh Hoang Thi Ngoc, Huyen Giang Thi Thu, Tai Le Quy

机构 * Secomus Technology(赛科默斯科技) FPT Software AI Center(FPT软件人工智能中心) Viettel Solutions(越南电信解决方案公司) Vietnam Ernst & Young Limited Company(越南安永有限公司) Banking Academy of Vietnam(越南银行学院) Vietnam Academy of Science and Technology(越南科学技术研究院) University of Koblenz(科布伦茨大学)

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 该研究提出以人为本的AI系统ConnectED,基于VietEduQwen构建,支持越南教育完整教学生命周期,经评估其准确率优于基准模型,可缩短教师备课时间且获师生高满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26777 2026-07-30 cs.SE 新提交 74%

CodeSpec: Dual Executable Specifications for Agentic Long-Horizon Feature Development

CodeSpec:面向智能体长周期功能开发的双可执行规范

Peiding Wang, Li Zhang, Fang Liu, Taichuan Li, Yinghao Zhu

专题命中 规划决策 :agentic(title);分类 cs.SE

AI总结 提出CodeSpec双可执行规范方法,通过配对子需求语义与仓库架构构建可靠功能链,在FeatureBench上优于基线,提升了长周期功能开发的设计与实现一致性及性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26160 2026-07-30 cs.AI 新提交 74%

GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning

GuideSkill:面向基于指南的临床推理的可执行大语言模型智能体技能演化框架

Lang Cao, Yuhao Shen, Tianyang Luo, Simo Du, Hao Peng, Yue Guo

专题命中 规划决策 :agent(title);分类 cs.AI

AI总结 本文提出与模型无关的GuideSkill框架,通过可执行技能结合指南流程与病例诊断模式,在多基准和骨干模型上显著提升临床推理性能,技能可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20827 2026-07-24 cs.AI 新提交 74%

Auditing Provenance Sensitivity in LLM Agent Action Selection

审计大语言模型智能体动作选择中的溯源敏感性

Junchi Liao

专题命中 规划决策 :agent(title);分类 cs.AI

AI总结 研究大语言模型智能体动作选择中的溯源敏感性,引入针对特定目标的授权审计,通过改变命题源权威等测试行为,发现可信和不可信变体在部分案例中产生不同动作,模型对线索有反应但不可信证据仍影响行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20470 2026-07-24 cs.AI 新提交 74%

PlanE: Meta Planning of Data, Tuning, and Inference for Extractive-based LLMs

PlanE:基于抽取式大语言模型的数据、调优和推理的元规划

Jiacheng Wang, Weiyan Zhang, Guangya Yu

机构 * Ant Group(蚂蚁集团) School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院)

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 针对大语言模型特定任务能力提升中数据标注成本高及缺乏优化方法的问题,提出PlanE框架,含数据分解等,引入DTI规划器,实验验证了该框架及规划器在不同场景下的有效性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏