arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-27 至 2026-08-27 共收录 87 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 4 篇

2608.21712 2026-08-27 cs.AI cs.MA 版本更新 85%

ATHENA: Knowledge-guided agentic neural architecture search for AutoFormer-based electronic health record modeling

ATHENA:面向基于AutoFormer的电子健康记录建模的知识引导型智能体神经架构搜索

Deyi Li, Qi Xu, Lingyao Li, Tiansheng Wang, Muxuan Liang, Mei Liu

机构 * University of Florida(佛罗里达大学) University of Arizona(亚利桑那大学) University of Houston(休斯顿大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本研究提出知识引导型智能体NAS框架ATHENA,通过跨医院复用架构知识,在6项临床预测任务的12项评估中9项优于或匹配基线方法,可减少Transformer型EHR建模的手动架构调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27309 2026-08-27 cs.SE 版本更新 79%

SIGIL: Compiling Agent Skills into Typed Harnesses

SIGIL:将智能体技能编译为类型化工具框架

Jayanaka Dantanarayana, Savini Kashmira, Lingjia Tang, Jason Mars

专题命中 工具调用 :agent(title,abstract);分类 cs.SE

AI总结 SIGIL通过Skill Compilation将散文式智能体技能编译为类型化工具框架,提升了智能体执行技能要求步骤的比例、完整过程的频率并减少token使用,且效果与模型无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27140 2026-08-27 cs.AI 版本更新 79%

StepOPSD: Step-Aware Online Preference Self-Distillation for Agent Reinforcement Learning

StepOPSD: 面向智能体强化学习的步骤感知在线偏好蒸馏

Yanfei Zhang, Xu Lin, Chenglin Wu

机构 * Independent Researcher(独立研究者) Tencent(腾讯) DeepWisdom(深智沃)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 提出StepOPSD框架,以智能体步骤为信用分配单元,通过事后增强教师上下文重新评分步骤段,并在GRPO更新前进行归一化每步信用预算的优势塑造,解决多轮智能体强化学习中的信用分配不匹配问题。

Comments Already been accepted as an EMNLP2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06087 2026-08-27 cs.CL cs.AI 版本更新 62%

LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents

LatentSkill: 从上下文文本技能到LLM智能体的权重内隐技能

Aofan Yu, Chenyu Zhou, Tianyi Xu, Zihan Guo, Rong Shan, Zhihui Fu, Jun Wang, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Sun Yat-Sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) OPPO Research Institute(OPPO研究院)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出LatentSkill框架,通过预训练超网络将文本技能转换为即插即用的LoRA适配器,将技能知识存储在权重空间而非上下文空间,从而减少预填充令牌并提升性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 24 篇

2602.08603 2026-08-27 cs.AI 版本更新 88%

OSCAR: Optimization-Steered Agentic Planning for Composed Image Retrieval

OSCAR:基于优化的代理规划用于组合图像检索

Teng Wang, Rong Shan, Jianghao Lin, Junjie Wu, Tianyi Xu, Jianping Zhang, Wenteng Chen, Changwang Zhang, Zhaoxiang Wang, Weinan Zhang, Jun Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :planning(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 OSCAR通过优化引导的代理规划框架,提升组合图像检索的性能,仅用10%训练数据即超越现有最佳方法。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21054 2026-08-27 cs.AI cs.CL 版本更新 84%

Reasoning or Rambling? Exploring the Effect of Thinking on Agent Persuasion

推理还是漫谈?探究思考过程对智能体说服能力的影响

Haodong Zhao, Jidong Li, Zhaomin Wu, Tianjie Ju, Zhuosheng Zhang, Bingsheng He, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) National University of Singapore(新加坡国立大学) Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)

专题命中 规划决策 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文对比通用LLM与LRM,发现推理对智能体说服能力存在二元性影响,还揭示其依赖表面线索的漏洞,提出提示级对抗性论点检测方法以提升鲁棒性。

Comments Accepted as EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16287 2026-08-27 cs.LG 版本更新 79%

SCALE: State-Calibrated Latent Embeddings for JEPA Planning in the Right Geometry

SCALE:用于正确几何空间中JEPA规划的状态校准潜在嵌入

Jiaming Hu, Yan Zheng, Tian Wang

机构 * Boston University(波士顿大学) Unity Technologies(Unity科技公司)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 该研究提出SCALE正则化器,为LeWM表示校准几何属性,在多任务、多求解器和多计算预算下均提升规划性能,证明规划依赖信息对几何的塑造作用。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21946 2026-08-27 cs.CL cs.AI cs.LG 版本更新 78%

EDGE: Experience-Distillation for Guided Exploration in Agentic Reinforcement Learning

EDGE:智能体强化学习中引导探索的经验蒸馏方法

Can Xie, Yuyi Zhou, Wen Yang, Ziyi zhang, Siyao Song, Yingzhuo Deng, Shuo Ren, Jiajun Zhang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Wuhan AI Research(武汉人工智能研究院)

专题命中 规划决策 :agentic(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出EDGE框架,将检索的经验内化到策略中,在ALFWorld和WebShop数据集7B规模下较GRPO提升8.3、12.5个成功率百分点,移除外部经验后仍保留96.0%支架性能。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17172 2026-08-27 cs.NE 版本更新 78%

Automating Parent Selection Configuration in Genetic Programming with Agentic AI

用智能体人工智能实现遗传编程中父代选择配置的自动化

Jose Guadalupe Hernandez, Jui-Hsuan Chang, Anil Kumar Saini, Xi Li, Jason H. Moore

专题命中 规划决策 :agentic(title,abstract)

AI总结 该研究提出智能体AI框架,结合LLM推理与RAG实现遗传编程父代选择配置自动化,经符号回归测试,5 mini--AR配置表现优于锦标赛选择,为进化系统自动化设计提供了新路径。

Comments Updated Benchmarking figure with correct statistical test results

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13403 2026-08-27 cs.RO 版本更新 78%

Min-Max Regret Task Allocation and Planning of Heterogeneous Multi-Robot System in Partially Known Environments

部分已知环境中异构多机器人系统的最小-最大遗憾任务分配与规划

Xinkai Liang, Huixuan Chan, Ying Liu, Yangxi Shi, Hao Fang

专题命中 规划决策 :planning(title,abstract)

AI总结 针对部分已知环境中异构多机器人系统任务分配难题,提出基于最小-最大遗憾优化的框架,用区域绑定原子命题捕获资源不确定性,借助扩展规划决策树及新型分支定界策略,实现近线性可扩展性,性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18073 2026-08-27 cs.AI cs.CL cs.LG 版本更新 75%

Infer Human's Intentions Before Following Natural Language Instructions

在遵循自然语言指令前推断人类的意图

Yanming Wan, Yue Wu, Yiping Wang, Jiayuan Mao, Natasha Jaques

专题命中 规划决策 :AI agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究针对人类指令的歧义问题,提出FISER框架,通过显式推断人类意图改进协作具身任务的指令遵循,在HandMeThat基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22899 2026-08-27 cs.AI 版本更新 70%

CDEG: Learning Decision-Critical Evidence for Long-Horizon Diagnostic Agents

CDEG:为长程诊断智能体学习决策关键证据

Xiwei Dai, Zijie Meng, Zhiting Fan, Yixuan Tang, Guanyu Jiang, Ziru Niu, Zuozhu Liu

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究提出基于图的框架CDEG,通过对比同一病例的成功与失败轨迹、受控反事实干预等学习决策关键证据,在多基准测试中使长程诊断智能体准确率最高提升11.5%。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14857 2026-08-27 cs.AI 版本更新 70%

World Models for Policy Refinement in StarCraft II

为《星际2》政策细化设计的世界模型

Yixin Zhang, Ziyi Wang, Yiming Rong, Haoxi Wang, Jinling Jiang, Shuang Xu, Haoran Wu, Shiyu Zhou, Bo Xu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 规划决策 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 StarWM为《星际2》政策细化设计的世界模型,通过预测未来观察和结构化文本表示提升策略决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12065 2026-08-27 cs.RO 版本更新 67%

Scene2Demo: Self-Evolving Embodied Data Generation via Object-Action Graph

具身学习的可扩展任务生成:基于 affordance 的任务世界

Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 本文提出 AGT-World 框架,通过结构化图方法实现任务空间的精确分解,并结合混合反馈机制实现策略的自进化,从而提升机器人任务生成的可扩展性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26865 2026-08-27 stat.ML cs.AI cs.IT cs.LG 版本更新 62%

Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

短思考、智能延迟、行动与循环:面向边缘大语言模型智能体的校准推理与感知不确定性的延迟机制

Amirmohammad Farzaneh, Osvaldo Simeone

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TSDS框架,结合收敛探测器与困惑度延迟规则,经LTT流程校准后,可在边缘LLM智能体上减少43%-73%的思考计算量,同时保证奖励与云端调用率,在多类基准任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24588 2026-08-27 cs.LG 版本更新 57%

IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents

IAPO:面向多轮服务智能体信用分配的感知影响策略优化

Bo Ren, Yirong Mao, Yi Yang, Wenhui Que

机构 * Fudan University(复旦大学) WeChat, Tencent Inc.(腾讯公司微信业务)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本研究提出IAPO方法,将轨迹转化为影响依赖图以优化多轮服务智能体的信用分配,在三个服务智能体基准及BFCL-v4多轮任务上,性能优于多轮RL基线。

Comments 12 pages, 3 figures, 5 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05545 2026-08-27 cs.CY cs.AI cs.HC 版本更新 57%

Vibe Compiler: A Research-Logic Synthesis Tool That Runs without Prompt Engineering -Toward Enhancing Metacognition for Sustaining Agency in the Age of Generative AI-

Vibe Compiler:无需提示工程即可运行的研究逻辑综合工具——迈向生成式AI时代维持智能体的元认知

Riichiro Mizoguchi, Tomoki Aburatani, Kento Koike, Machi Shimmei

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 针对生成式AI可能侵蚀人类认知智能体的问题,提出基于综合-分析互惠模型的Vibe Compiler工具,通过16个学术参数的本体编译研究想法,以反思性问题引导研究人员,减少对复杂提示的依赖,提升AI辅助推理效果。

Comments 98 pages, 3 figures. English version (pp. 1-54) followed by a Japanese version (pp. 55-98)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26924 2026-08-27 cs.LG cs.RO 版本更新 57%

Temporally Centered SIGReg Improves LeWorldModel Representations for Robot Policy Learning

时间中心SIGReg改进多任务LeWorldModel学习:从分析到方法

Chang Liu, Fei Suo, Yanzhou Jin, Zeyu Ping, Yusuke Iwasawa, Yutaka Matsuo, Yaonan Zhu

机构 * Graduate School of Engineering, The University of Tokyo(东京大学工程学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究针对SIGReg在多任务LeWM中导致表示混叠的问题,提出将其应用于时间中心残差的改进方法,在LIBERO基准上显著提升了多任务世界模型的下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05925 2026-08-27 cs.AI 版本更新 57%

Towards World Models in Biomedical Research

迈向生物医学研究的世界模型

Guangyu Wang, Jingkun Yue, Siqi Zhang, Yu Liu, Xiaoyu Wang, Mingyuan Meng, Changwei Ji, Zongbo Han, Yulin Wang, Yang Yue, Frank Fu, Ting Chen, Song Wu, Ziwei Liu, Jiangning Song, Ming Li, Gao Huang, Xiaohong Liu, Athanasios Vasilakos, Xingcai Zhang, Ping Zhang, Yong Li

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing, China(网络与交换技术国家重点实验室,北京邮电大学,北京,中国) Department of Engineering Science, University of Oxford, Oxford, United Kingdom(英国牛津大学工程科学系,牛津,英国) Institute of Medical Artificial Intelligence, South China Hospital, Medical School, Shenzhen University, Shenzhen, Guangdong, China(医学人工智能研究所,南方医院,医学学院,深圳大学,深圳,广东,中国) Zhongguancun Academy & Zhongguancun Institute of Artificial Intelligence, Beijing, China(中关村学院及中关村人工智能研究院,北京,中国) Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University, 100084, Beijing, China(北京信息科学与技术国家研究中心(BNRist),清华大学,100084,北京,中国) Department of Chemical and Nano Engineering, University of California, San Diego, La Jolla, CA, USA(美国加州大学圣地亚哥分校化学与纳米工程系,La Jolla,CA,美国) Nanyang Technological University, Singapore(新加坡南洋理工大学) Monash Biomedicine Discovery Institute and Department of Biochemistry and Molecular Biology, Monash University, Melbourne, Victoria, Australia(莫纳什大学生物医学发现研究所和生物化学与分子生物学系,墨尔本,维多利亚,澳大利亚) David R. Cheriton School of Computer Science, University of Waterloo, Waterloo, Ontario, Canada(加拿大滑铁卢大学戴维·R·切里顿计算机科学学校,滑铁卢,安大略,加拿大) Department of ICT and Center for AI Research, University of Agder (UiA), Jon Lilletuns vei 9, Grimstad, Norway(挪威阿格德大学(UiA)信息与通信技术系及人工智能研究中心,Jon Lilletuns vei 9,Grimstad,挪威) Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出生物医学世界模型作为AI驱动发现的新范式,通过学习分子、细胞、组织和临床状态的潜在表征及干预条件动态,实现未来轨迹模拟,并探讨其在虚拟细胞、类器官、虚拟患者和手术模拟等应用中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30837 2026-08-27 cs.CR cs.LG 版本更新 57%

Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense

先派侦察兵:提示注入防御中自适应检测器分配的预推理方法

Shuhao Zhang, Jiarui Li, Qi Cao, Ruiyi Zhang, Pengtao Xie

机构 * UC San Diego(加州大学圣迭戈分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 针对提示注入检测器异构且不可靠的问题,提出SCOUT框架,通过预测每个检测器对每个样本的可靠性和延迟,动态分配检测器,实现安全性与效率的权衡。

Comments We propose SCOUT, a detector allocation framework that predicts each detector's accuracy and latency on a given input before running it, letting operators control the safety-utility trade-off with a single threshold and route to an LLM judge only when needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25981 2026-08-27 cs.CL 版本更新 57%

AgentDiff: Meaning-Bearing Rewrites Trigger Deeper Divergence than Presentation Changes in LLM Agents

LLM 代理何时对表面噪声与语义噪声做出不同处理?一项基于 68 个单元格的测量研究及留出轨迹级验证

Liyun Zhang, Jiayi Guo

机构 * School of Information and Software Engineering, UESTC(信息与软件工程学院,电子科技大学) Jacobs School of Engineering, UC San Diego(工程学院,加州大学圣地亚哥分校)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 本研究通过 68 个单元格的测量实验,发现大语言模型驱动的思维链和 ReAct 代理对语义扰动(如释义、同义词)比表现扰动(如格式、重排序)更敏感,并基于留出模型和轨迹级机制分析提出了“隐蔽发散”解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09062 2026-08-27 cs.CL 版本更新 57%

ReFIne: A Framework for Trustworthy Large Reasoning Models with Reliability, Faithfulness, and Interpretability

ReFIne:兼具可靠性、忠实性与可解释性的可信赖大型推理模型框架

Chung-En Sun, Ge Yan, Akshay Kulkarni, Tsui-Wei Weng

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 该研究提出 ReFIne 框架,结合监督微调与 GRPO 训练 Qwen3 模型,使其在数学基准上的推理轨迹可解释性、忠实性、可靠性均显著提升,推动推理模型向多维度可信赖性优化发展。

Comments Accpepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10041 2026-08-27 cs.AI math.OC 版本更新 57%

Topology-Guided Modular Actor-Critic Learning for Continuous Systems under Temporal Objectives

面向时间目标的连续系统的拓扑引导模块化演员-评论家学习

Lening Li, Zhentian Qian, Jianan Xia, Yawen Wang, Zhongjing Li, Qiren Geng, Huasheng Zhang, Liang Hu, Qishuang Li, Junqiang Lou

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 该研究针对受线性时间逻辑约束的连续状态随机动态系统,提出拓扑引导的模块化演员-评论家强化学习算法,在CartPole和Dubins车任务上验证了方法的有效性与优越性。

Comments 12 pages, 6 figures. Submitted to IC&C 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23673 2026-08-27 astro-ph.GA 版本更新 50%

A simulation-based quality-control framework for the broad-line region radius-luminosity relation

基于模拟的宽线区半径-光度关系质量控制框架

Juri Wladimir Seib, Francisco Pozo Nuñez, Sarah Elena Ivana Bosman

专题命中 规划决策 :planning(abstract)

AI总结 该研究针对活动星系核Hβ宽线区半径-光度关系的观测散射,开发模拟质量控制框架,发现约40%源的时延恢复存在偏差,校正后内禀散射显著降低,相关工具公开可用。

Comments Accepted for publication in A&A, Updated the version to match language edited and final submitted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23319 2026-08-27 cs.DS 版本更新 50%

Tractable Maximization of Budgeted Phylogenetic Diversity on Networks Utilizing Node Scanwidth

利用节点扫描宽度在网络上有预算地最大化系统发育多样性的可处理性

Niels Holtgrefe, Jannik Schestag

专题命中 规划决策 :planning(abstract)

AI总结 本文利用节点扫描宽度参数,提出了三种预算约束下系统发育网络多样性最大化问题的精确算法,其中两种可在 O*(2^nsw B^2) 时间内求解,第三种在 O*(3^nsw) 时间内计算多样性得分,并首次给出节点扫描宽度的精确计算算法。

Comments Submitted to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19614 2026-08-27 cs.IT 版本更新 50%

Goal-Oriented Semantic Communication for Logical Decision Making

面向逻辑决策的语义通信

Ahmet Faruk Saz, Faramarz Fekri

专题命中 规划决策 :autonomous agent(abstract)

AI总结 本文提出基于一阶逻辑的可解释语义通信框架,用于协作感知中的逻辑决策。通过定义语义信息和熵,实现目标导向的信息传输,确保决策的逻辑可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16694 2026-08-27 cs.CR 版本更新 50%

An Empirical Study of Observability Limits in Advanced Software Supply Chain Attacks

SynthChain:一种合成基准和高级隐蔽软件供应链攻击的取证分析

Zhuoran Tan, Wenbo Guo, Jiewen Luo, Taylor Brierley, Jeremy Singer, Christos Anagnostopoulos

专题命中 规划决策 :planning(abstract)

AI总结 SynthChain通过真实恶意包和攻击方案构建多源运行数据集,提供链级真实标签,用于研究受限 telemetry 下软件供应链攻击的检测与取证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14855 2026-08-27 cs.CR 版本更新 50%

Practice-Informed, Practice-Ready: An AI security incident taxonomy

实践导向、可落地实践的AI安全事件分类法

Lukas Bieringer, Sean McGregor, Nicole Nichols, Kevin Paeth, Andrew Paverd, Jonathan Petit, Jochen Stängler, Andreas Wespi, Alexandre Alahi, Kathrin Grosse

专题命中 规划决策 :AI agent(abstract)

AI总结 该研究针对AI安全事件报告缺乏实用标准的问题,通过多领域从业者讨论构建了AI安全事件分类法,其可指导事件识别与措施推荐,且已成为行业标准的科学基础。

Comments Paper underlying ETSI AICIEC, under submission. Related Position paper accepted to SatML 2026: see previous version,

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多智能体 9 篇

2411.15356 2026-08-27 cs.AI cs.MA 版本更新 91%

Regulator-Manufacturer AI Agents Modeling: Mathematical Feedback-Driven Multi-Agent LLM Framework

监管方-制造商AI智能体建模:数学反馈驱动的多智能体大语言模型框架

Yu Han, Zekun Guo

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本研究提出数学反馈驱动的多智能体LLM框架,模拟监管动态,揭示监管转变对医疗器械行业行为的影响,为相关利益方提供优化监管实践与合规性的可操作见解。

Comments v3 adds a technical clarification note on the implementation and quantitative analyses; the body of the paper is unchanged from v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09772 2026-08-27 cs.AI 版本更新 90%

Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning

两个脑袋胜过一个:测试时扩展多智能体协作推理

Can Jin, Hongwu Peng, Qixin Zhang, Yang Zhou, Yujin Tang, Tong Che, Dimitris N. Metaxas

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 该研究针对单智能体测试时扩展(TTS)的瓶颈,提出用多智能体系统(MAS)升级TTS,引入M500数据集并结合CEO智能体的自适应策略,微调的Qwen2.5-32B-MAS等模型性能优于基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏