arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-27 至 2026-08-27 共收录 205 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 61 篇

2608.21946 2026-08-27 cs.CL cs.AI cs.LG 版本更新 78%

EDGE: Experience-Distillation for Guided Exploration in Agentic Reinforcement Learning

EDGE:智能体强化学习中引导探索的经验蒸馏方法

Can Xie, Yuyi Zhou, Wen Yang, Ziyi zhang, Siyao Song, Yingzhuo Deng, Shuo Ren, Jiajun Zhang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Wuhan AI Research(武汉人工智能研究院)

专题命中 规划决策 :agentic(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出EDGE框架,将检索的经验内化到策略中,在ALFWorld和WebShop数据集7B规模下较GRPO提升8.3、12.5个成功率百分点,移除外部经验后仍保留96.0%支架性能。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17172 2026-08-27 cs.NE 版本更新 78%

Automating Parent Selection Configuration in Genetic Programming with Agentic AI

用智能体人工智能实现遗传编程中父代选择配置的自动化

Jose Guadalupe Hernandez, Jui-Hsuan Chang, Anil Kumar Saini, Xi Li, Jason H. Moore

专题命中 规划决策 :agentic(title,abstract)

AI总结 该研究提出智能体AI框架,结合LLM推理与RAG实现遗传编程父代选择配置自动化,经符号回归测试,5 mini--AR配置表现优于锦标赛选择,为进化系统自动化设计提供了新路径。

Comments Updated Benchmarking figure with correct statistical test results

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13403 2026-08-27 cs.RO 版本更新 78%

Min-Max Regret Task Allocation and Planning of Heterogeneous Multi-Robot System in Partially Known Environments

部分已知环境中异构多机器人系统的最小-最大遗憾任务分配与规划

Xinkai Liang, Huixuan Chan, Ying Liu, Yangxi Shi, Hao Fang

专题命中 规划决策 :planning(title,abstract)

AI总结 针对部分已知环境中异构多机器人系统任务分配难题,提出基于最小-最大遗憾优化的框架,用区域绑定原子命题捕获资源不确定性,借助扩展规划决策树及新型分支定界策略,实现近线性可扩展性,性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25723 2026-08-27 cs.LG cs.AI 新提交 76%

It's a matter of timescale: non-linear utility in successor features and multi-objective planning and learning

这是一个时间尺度问题:后继特征与多目标规划和学习中的非线性效用

Liam P.H. Mertens, Lucas N. Alegre, Florent Delgrange, Diederik M. Roijers, Ann Nowé, Peter Vamplew

机构 * AI Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学AI实验室) Institute of Informatics - Federal University of Rio Grande do Sul(南大河州联邦大学信息学研究所) Federation University Australia(澳大利亚联邦大学)

专题命中 规划决策 :planning(title);分类 cs.AI、cs.LG

AI总结 本文针对多目标强化学习及后继特征方法未考虑同一决策问题中不同时间尺度非线性效用效应的不足,通过示例论证后提出新视角,指出相关研究存在显著空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18073 2026-08-27 cs.AI cs.CL cs.LG 版本更新 75%

Infer Human's Intentions Before Following Natural Language Instructions

在遵循自然语言指令前推断人类的意图

Yanming Wan, Yue Wu, Yiping Wang, Jiayuan Mao, Natasha Jaques

专题命中 规划决策 :AI agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究针对人类指令的歧义问题,提出FISER框架,通过显式推断人类意图改进协作具身任务的指令遵循,在HandMeThat基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25518 2026-08-27 cs.AI 新提交 74%

Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

智能体游戏开发:用于扩展世界模型的可验证轨迹数据引擎

Pengfei Zhou, Hexin Wang, Zhengfeiyang Zhang, Yixing Ma, Zhenglin Wan, Kaipeng Zhang, Wangbo Zhao, Yang You

机构 * Cardinal AI Lab(卡迪纳尔人工智能实验室) University of California, Berkeley(加州大学伯克利分校) Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国立大学) HPC-AI Lab(高性能计算与人工智能实验室)

专题命中 规划决策 :agentic(title);分类 cs.AI

AI总结 本文指出扩展世界模型的传统策略效率低,提出将游戏开发作为可验证轨迹数据引擎,构建RLHEV后训练范式,为空间世界模型提供高质量奖励信号与长程轨迹数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25474 2026-08-27 cs.CR cs.SE 新提交 74%

Separating Disclosure from Authorization: Field-Tier Minimization for Agent Action Mediation

将授权与披露分离:面向智能体动作调解的字段层级最小化

Jiten Oswal, John Cadeddu

专题命中 规划决策 :agent(title);分类 cs.SE

AI总结 该研究提出智能体动作调解的字段层级最小化方法,将参数字段分为三类,实现授权与披露分离,解决事实计算方问题并分析泄露,保障账本安全与审计需求。

Comments 19 pages, 2 figures, 5 tables. Describes an implemented system in private pilot deployment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25771 2026-08-27 cs.HC cs.LG 新提交 70%

Large Language Model Few-Shot Prompting with Dilemma Training Outperforms Human Surrogates in Predicting Patient Preferences

采用困境训练的大语言模型少样本提示在预测患者偏好方面优于人类替代者

Natasha Ureyang, Sebastian Porsdam Mann, Yuxin Liu, Zuriel Hassirim, Melanie Almonte, Wenhao Chen, Joyce Ng, Thant Nay Lin, Aung Thiha, Gerald CH Koh, Brian David Earp, Pin Sym Foong

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 该研究提出采用困境训练的P4-DT智能体,通过12组患者-替代者配对实验,其预测患者治疗选择的准确率达81.7%,优于人类替代者及相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25622 2026-08-27 cs.CV cs.CL 新提交 70%

Plans You Can Check: Verifier-Grounded Learning of an Open-Weight Planner for Executable Video-Editing

可核查的方案:基于验证器的可执行视频编辑开放权重规划器学习

Haoyu Wang, Cheng Feng, Liuyang Bian, Ruiyang Huang, Lei Wei, Yafei Wen, Xiaoxin Chen, Xiaoying Tang

机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) vivo AI Lab(vivo AI实验室) University of the Chinese Academy of Sciences(中国科学院大学) Southeast University(东南大学) Peking University(北京大学) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence, CUHK-Shenzhen(香港中文大学(深圳)广东省未来智能网络重点实验室)

专题命中 规划决策 :planning(abstract);workflow(abstract);分类 cs.CL

AI总结 针对可执行视频编辑规划问题,提出基于验证器的RefineCut及RefineCut-Evo方法,训练8B开放权重规划器,在基准上取得优于前沿模型的效果,代码与基准已公开。

Comments Accepted to the Main Conference of EMNLP '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25215 2026-08-27 cs.AI cs.MA q-bio.QM 新提交 70%

Federation Is Nearly Free, Reasoning Is Not: Tradeoffs for AI Co-Scientists in Protein Characterization Workflows

联合近乎免费,推理并非如此:AI 联合科学家在蛋白质表征工作流中的权衡

Maia Kapur, Timothy Boe, Abby Jerger, Paul Rigor

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究在生产级科学智能体平台上,对比联合拓扑、PPO策略及不同LLM等,发现LLM选择对蛋白质表征预测质量影响最大,PPO策略成本低且一致性好,联合对性能影响可忽略,为科学工作流智能体部署提供了指导。

Comments 24 Pages, 4 main figures, 5 main tables, 2 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22899 2026-08-27 cs.AI 版本更新 70%

CDEG: Learning Decision-Critical Evidence for Long-Horizon Diagnostic Agents

CDEG:为长程诊断智能体学习决策关键证据

Xiwei Dai, Zijie Meng, Zhiting Fan, Yixuan Tang, Guanyu Jiang, Ziru Niu, Zuozhu Liu

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究提出基于图的框架CDEG,通过对比同一病例的成功与失败轨迹、受控反事实干预等学习决策关键证据,在多基准测试中使长程诊断智能体准确率最高提升11.5%。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14857 2026-08-27 cs.AI 版本更新 70%

World Models for Policy Refinement in StarCraft II

为《星际2》政策细化设计的世界模型

Yixin Zhang, Ziyi Wang, Yiming Rong, Haoxi Wang, Jinling Jiang, Shuang Xu, Haoran Wu, Shiyu Zhou, Bo Xu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 规划决策 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 StarWM为《星际2》政策细化设计的世界模型,通过预测未来观察和结构化文本表示提升策略决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25117 2026-08-27 cs.HC 新提交 67%

Teaching Geometric Proof with Tech: Pitfalls and Possibilities

技术辅助几何证明教学:误区与可能性

Hwei-Shin Harriman, Wode Ni, Yuchen Jin, Dominik Moritz, Joshua Sunshine

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 该研究通过访谈18名几何教师、审查33款工具,发现数字工具在几何证明正式教学中存在不足,进而提出四项教育证明工具的设计准则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12065 2026-08-27 cs.RO 版本更新 67%

Scene2Demo: Self-Evolving Embodied Data Generation via Object-Action Graph

具身学习的可扩展任务生成:基于 affordance 的任务世界

Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 本文提出 AGT-World 框架,通过结构化图方法实现任务空间的精确分解,并结合混合反馈机制实现策略的自进化,从而提升机器人任务生成的可扩展性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26009 2026-08-27 cs.AI cs.LG cs.LO 新提交 62%

Imitation Learning for Connection-Tableau Construction

用于连接表构造的模仿学习

Fredrik Rømming, Mantas Bakšys, Martin S. Fixman, Sean B. Holden

机构 * University of Cambridge(剑桥大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究将连接表构造建模为迁移系统中的策略,结合模仿学习与图神经网络训练策略,在多个基准上较leanCoP提升了定理证明的问题解决率并大幅减少步数。

Comments 9 pages. Code: this https URL (https://github.com/fredrrom/connections)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25756 2026-08-27 cs.LG cs.AI 新提交 62%

TailSFT: Filtered Fine-Tuning Improves Post-Training Performance

TailSFT:过滤式微调提升后训练性能

Sadhika Malladi, Samy Jelassi, Dylan Foster, Jordan T. Ash, Akshay Krishnamurthy

机构 * University of California San Diego(加州大学圣迭戈分校) Microsoft Research NYC(微软研究院纽约分部)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TailSFT过滤式微调算法,可提升模型后强化学习性能,在OLMo-3 7B上数学与代码评估pass@16最高提17%,后续GRPO的pass@1最高提4%,还引入轻量诊断方法识别适用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25592 2026-08-27 cond-mat.mtrl-sci cs.AI cs.LG 新提交 62%

A Hierarchical Synergistic Deep Learning Framework Integrating Composition, Structure, and Ionic Transport for Solid-State Electrolyte Discovery

一种整合组分、结构与离子传输的分层协同深度学习框架用于固态电解质发现

Hongwei Du, Dingyang Lv, Baole Wei, Yongheng Li, Feng Yu, Ziheng Lu, Siqi Shi, Hong Wang

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发了整合组分、结构与离子传输的分层协同深度学习框架,筛选出97种高性能固态电解质候选物,揭示Li⁺跳跃网络连通性是室温离子电导率核心决定因素,为固态电解质发现提供新方法。

Comments 22 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26865 2026-08-27 stat.ML cs.AI cs.IT cs.LG 版本更新 62%

Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

短思考、智能延迟、行动与循环:面向边缘大语言模型智能体的校准推理与感知不确定性的延迟机制

Amirmohammad Farzaneh, Osvaldo Simeone

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TSDS框架,结合收敛探测器与困惑度延迟规则,经LTT流程校准后,可在边缘LLM智能体上减少43%-73%的思考计算量,同时保证奖励与云端调用率,在多类基准任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26074 2026-08-27 cs.RO cs.AI 新提交 61%

Gating Before Commitment: Anticipating Intent Divergence to Prevent Post-Interaction Decision Failures in Autonomous Driving

承诺前的门控:预测意图分歧以防止自动驾驶中交互后的决策失败

Cong Xu, Ravi Sankar

机构 * University of South Florida(南佛罗里达大学)

专题命中 规划决策 :planning(abstract,comments);分类 cs.AI

AI总结 该研究提出承诺前的门控决策层,通过语言引导意图模块检测自动驾驶车辆交互中的意图分歧,可修复规划、降低误触发率,其对故障的最快检测和不确定性否决作用获实验支持。

Comments 8 pages, 4 figures. Submitted to the 16th Workshop on Planning, Perception and Navigation for Intelligent Vehicles (PPNIV) at IROS 2026. Supplementary video included as ancillary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25968 2026-08-27 cs.AI 新提交 57%

Quantitative Analysis of $ω$-Regular Robust MDPs

ω-正则鲁棒马尔可夫决策过程的定量分析

Ali Asadi, Krishnendu Chatterjee, Ehsan Kafshdar Goharshady, Mehrdad Karrabi, Alipasha Montaseri, Ali Shafiee

机构 * Institute of Science and Technology Austria(奥地利科学技术研究所)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 该研究针对线性定义不确定性集的(s,a)-矩形鲁棒马尔可夫决策过程,解决了ω-正则奇偶性目标的定量分析问题,证明存在纯无记忆最优策略并提出多项式时间算法,通过实验与随机博弈方法对比验证了效果。

Comments 26 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25871 2026-08-27 cs.LG 新提交 57%

CEDAR: Controlled and Event-Driven Demand Forecasting via Residual Decomposition

CEDAR:基于残差分解的可控事件驱动需求预测

Junjie Meng, Ranxu Zhang, Zi-an Zhang, Shujun Liu, Xiaoning Qi, Xiaozhou Xu, Yanyong Zhang, Hui Xiong, Chao Wang

机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) Alibaba Group(阿里巴巴集团) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能学域)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究针对现有时间序列预测方法对策略不敏感、反事实分析不可靠的问题,提出基于残差分解的两阶段框架CEDAR,在阿里1688数据集上验证其可提升模拟精度并助力预算规划。

Comments 12 pages, 4 figures, 5 tables. Published in KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25572 2026-08-27 cs.RO cs.AI 新提交 57%

ConfAL-WM: Confidence-Guided Active Learning for Action-Conditioned World Models

ConfAL-WM:用于动作条件世界模型的置信度引导主动学习

Xiang Liu, Sen Cui, Changshui Zhang

机构 * Tsinghua University(清华大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对动作条件世界模型在新场景下的局部错误问题,提出ConfAL-WM框架,基于EVAC和UNet实现置信度引导的高效数据选择与局部训练增强,在RoboTwin2.0上验证了其提升训练效率与预测质量的效果。

Comments Project page: this https URL (https://ConfAL-WM.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25276 2026-08-27 cs.CL 新提交 57%

Groundhog Bit-Flip Attack: Seeding Infinite Generation Loops in Mixture-of-Experts LLMs through Bit Flips

土拨比特翻转攻击:通过比特翻转在混合专家大语言模型中植入无限生成循环

Huakang Lin, Tiancheng Zheng, Mingxuan Sun, Tianhong Xu, Fan Zhang, Yunsi Fei, Ruyi Ding

机构 * Louisiana State University(路易斯安那州立大学) Northeastern University(东北大学) Zhejiang University(浙江大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Southeast University(东南大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 本研究提出首个针对混合专家大语言模型的土拨比特翻转攻击,通过翻转路由层相关比特,可使平均输出膨胀率达5912%,揭示了MoE架构的鲁棒性漏洞。

Comments 9 pages, 3 figures; Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24891 2026-08-27 cs.AI 新提交 57%

Measurement-Budget Allocation in Quantum Learning with Finite-Shot Generalization Guarantees

Ferhat Ozgur Catak

机构 * University of Stavanger(斯塔万格大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24588 2026-08-27 cs.LG 版本更新 57%

IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents

IAPO:面向多轮服务智能体信用分配的感知影响策略优化

Bo Ren, Yirong Mao, Yi Yang, Wenhui Que

机构 * Fudan University(复旦大学) WeChat, Tencent Inc.(腾讯公司微信业务)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本研究提出IAPO方法,将轨迹转化为影响依赖图以优化多轮服务智能体的信用分配,在三个服务智能体基准及BFCL-v4多轮任务上,性能优于多轮RL基线。

Comments 12 pages, 3 figures, 5 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05545 2026-08-27 cs.CY cs.AI cs.HC 版本更新 57%

Vibe Compiler: A Research-Logic Synthesis Tool That Runs without Prompt Engineering -Toward Enhancing Metacognition for Sustaining Agency in the Age of Generative AI-

Vibe Compiler:无需提示工程即可运行的研究逻辑综合工具——迈向生成式AI时代维持智能体的元认知

Riichiro Mizoguchi, Tomoki Aburatani, Kento Koike, Machi Shimmei

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 针对生成式AI可能侵蚀人类认知智能体的问题,提出基于综合-分析互惠模型的Vibe Compiler工具,通过16个学术参数的本体编译研究想法,以反思性问题引导研究人员,减少对复杂提示的依赖,提升AI辅助推理效果。

Comments 98 pages, 3 figures. English version (pp. 1-54) followed by a Japanese version (pp. 55-98)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26924 2026-08-27 cs.LG cs.RO 版本更新 57%

Temporally Centered SIGReg Improves LeWorldModel Representations for Robot Policy Learning

时间中心SIGReg改进多任务LeWorldModel学习:从分析到方法

Chang Liu, Fei Suo, Yanzhou Jin, Zeyu Ping, Yusuke Iwasawa, Yutaka Matsuo, Yaonan Zhu

机构 * Graduate School of Engineering, The University of Tokyo(东京大学工程学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究针对SIGReg在多任务LeWM中导致表示混叠的问题,提出将其应用于时间中心残差的改进方法,在LIBERO基准上显著提升了多任务世界模型的下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05925 2026-08-27 cs.AI 版本更新 57%

Towards World Models in Biomedical Research

迈向生物医学研究的世界模型

Guangyu Wang, Jingkun Yue, Siqi Zhang, Yu Liu, Xiaoyu Wang, Mingyuan Meng, Changwei Ji, Zongbo Han, Yulin Wang, Yang Yue, Frank Fu, Ting Chen, Song Wu, Ziwei Liu, Jiangning Song, Ming Li, Gao Huang, Xiaohong Liu, Athanasios Vasilakos, Xingcai Zhang, Ping Zhang, Yong Li

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing, China(网络与交换技术国家重点实验室,北京邮电大学,北京,中国) Department of Engineering Science, University of Oxford, Oxford, United Kingdom(英国牛津大学工程科学系,牛津,英国) Institute of Medical Artificial Intelligence, South China Hospital, Medical School, Shenzhen University, Shenzhen, Guangdong, China(医学人工智能研究所,南方医院,医学学院,深圳大学,深圳,广东,中国) Zhongguancun Academy & Zhongguancun Institute of Artificial Intelligence, Beijing, China(中关村学院及中关村人工智能研究院,北京,中国) Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University, 100084, Beijing, China(北京信息科学与技术国家研究中心(BNRist),清华大学,100084,北京,中国) Department of Chemical and Nano Engineering, University of California, San Diego, La Jolla, CA, USA(美国加州大学圣地亚哥分校化学与纳米工程系,La Jolla,CA,美国) Nanyang Technological University, Singapore(新加坡南洋理工大学) Monash Biomedicine Discovery Institute and Department of Biochemistry and Molecular Biology, Monash University, Melbourne, Victoria, Australia(莫纳什大学生物医学发现研究所和生物化学与分子生物学系,墨尔本,维多利亚,澳大利亚) David R. Cheriton School of Computer Science, University of Waterloo, Waterloo, Ontario, Canada(加拿大滑铁卢大学戴维·R·切里顿计算机科学学校,滑铁卢,安大略,加拿大) Department of ICT and Center for AI Research, University of Agder (UiA), Jon Lilletuns vei 9, Grimstad, Norway(挪威阿格德大学(UiA)信息与通信技术系及人工智能研究中心,Jon Lilletuns vei 9,Grimstad,挪威) Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出生物医学世界模型作为AI驱动发现的新范式,通过学习分子、细胞、组织和临床状态的潜在表征及干预条件动态,实现未来轨迹模拟,并探讨其在虚拟细胞、类器官、虚拟患者和手术模拟等应用中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30837 2026-08-27 cs.CR cs.LG 版本更新 57%

Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense

先派侦察兵:提示注入防御中自适应检测器分配的预推理方法

Shuhao Zhang, Jiarui Li, Qi Cao, Ruiyi Zhang, Pengtao Xie

机构 * UC San Diego(加州大学圣迭戈分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 针对提示注入检测器异构且不可靠的问题,提出SCOUT框架,通过预测每个检测器对每个样本的可靠性和延迟,动态分配检测器,实现安全性与效率的权衡。

Comments We propose SCOUT, a detector allocation framework that predicts each detector's accuracy and latency on a given input before running it, letting operators control the safety-utility trade-off with a single threshold and route to an LLM judge only when needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25981 2026-08-27 cs.CL 版本更新 57%

AgentDiff: Meaning-Bearing Rewrites Trigger Deeper Divergence than Presentation Changes in LLM Agents

LLM 代理何时对表面噪声与语义噪声做出不同处理?一项基于 68 个单元格的测量研究及留出轨迹级验证

Liyun Zhang, Jiayi Guo

机构 * School of Information and Software Engineering, UESTC(信息与软件工程学院,电子科技大学) Jacobs School of Engineering, UC San Diego(工程学院,加州大学圣地亚哥分校)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 本研究通过 68 个单元格的测量实验,发现大语言模型驱动的思维链和 ReAct 代理对语义扰动(如释义、同义词)比表现扰动(如格式、重排序)更敏感,并基于留出模型和轨迹级机制分析提出了“隐蔽发散”解释。

详情

展开后加载摘要…

URL PDF HTML 收藏