Indirect Prompt Injections: Are Firewalls All You Need, or Stronger Benchmarks?
间接提示注入:防火墙足够吗,还是需要更强的基准?
专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract)
AI总结 本文提出一种简单高效的防御机制,通过防火墙在代理-工具接口实现高安全性和实用性,同时指出现有基准的不足,并提出改进方案。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
间接提示注入:防火墙足够吗,还是需要更强的基准?
专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract)
AI总结 本文提出一种简单高效的防御机制,通过防火墙在代理-工具接口实现高安全性和实用性,同时指出现有基准的不足,并提出改进方案。
WorldAgents: 2D基础图像模型是否能作为3D世界模型的智能体?
机构 * Technical University of Munich(慕尼黑技术大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract)
AI总结 本文探讨2D基础图像模型是否具备3D世界生成能力,提出多智能体架构实现3D世界合成,通过实验验证2D模型能生成一致且逼真的3D世界。
Comments Webpage: https://ziyaerkoc.com/worldagents/ Video: https://www.youtube.com/watch?v=Mj2FqqhurdI
PostTrainBench: 大型语言模型代理能否自动化大型语言模型的后训练?
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 PostTrainBench研究LLM代理在受限制计算条件下自主进行后训练的能力,发现其在某些场景下可超越指令调优模型,但也存在奖励黑客等风险。
基于端点意识建模的流式实时轨迹预测
机构 * Institute of Visual Computing, Graz University of Technology(视觉计算研究所,格拉茨技术大学)
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)
AI总结 本文提出了一种基于端点意识建模的轻量高效流式轨迹预测方法,通过连续时间上下文传播提升预测精度并降低推理延迟,适用于自动驾驶场景。
Comments WACV 2026 Oral. Project Page at https://a-pru.github.io/seam/
HetroD:一种用于异质交通中自动驾驶的高保真无人机数据集和基准
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) ; UC Berkeley(伯克利大学) ; fka GmbH
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)
AI总结 HetroD通过高保真无人机数据集和基准,解决异质交通中自动驾驶面临的复杂行为预测与规划挑战。
Comments IEEE International Conference on Robotics and Automation (ICRA) 2026
AI代理生产力指数(APEX-Agents)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 APEX-Agents是一个评估AI代理执行长期跨应用任务的基准,通过测试八个代理展示了Gemini 3 Flash的高分表现,并开源了相关资源和基础设施。
大模型能帮你清理数据吗?基于大模型的应用级数据准备综述
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; Microsoft Research(微软研究院) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Shanghai AI Laboratory(上海人工智能实验室) ; Xiaohongshu Inc.(小红书公司) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Alibaba Group(阿里巴巴集团)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文综述了基于大语言模型的应用级数据准备方法,探讨了数据清洗、整合与丰富三大任务的技术、优势与局限,并提出了可扩展的大语言模型-数据系统和稳健评估协议的未来研究方向。
Comments Please refer to our repository for more details: https://github.com/weAIDB/awesome-data-llm
LiViBench:面向交互式直播视频理解的多模态基准测试
专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract)
AI总结 LiViBench是首个面向交互式直播视频的多模态基准测试,通过定制化两阶段指令微调和视频到评论检索模块,提升模型对直播视频的理解能力,并在多个基准测试中取得优异成绩。
Comments AAAI 2026 Main Track
机构AI:分布式AGI安全的治理框架
专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract)
AI总结 机构AI通过治理框架解决分布式AGI安全问题,将对齐视为治理机制设计问题,通过运行时监控、激励塑造和规范执行来约束代理行为。
通过大语言模型代理实现自主量子模拟
专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract)
AI总结 本文提出利用大语言模型代理实现自主量子模拟,通过上下文学习和多代理架构提升模拟效率与准确性。
机构 * NAVER Cloud HyperCLOVA X Team(NAVER云HyperCLOVA X团队)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
Comments Technical Report
幻觉与事实:大型语言模型中事实核查与事实性评估的综述
机构 * Department of Computer Science and Engineering, United International University, Dhaka 1212, Bangladesh(乌姆特国际大学计算机科学与工程系) ; Department of Computer Science and Engineering, Daffodil International University, Dhaka-1341, Bangladesh(达芙尼国际大学计算机科学与工程系) ; Faculty of Science and Technology, Charles Darwin University, Casuarina, NT 0909, Australia(查尔斯·达尔文大学科学与技术学院)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文综述了大型语言模型中事实核查与事实性评估的关键挑战及方法,强调了提升事实准确性的重要性。
Journal ref Artif. Intell. Rev. (2026)
IS-Bench:评估由视觉语言模型驱动的具身智能体在日常家务任务中的交互安全性
机构 * Xiaoya Lu 1, 2(某大学) ; Zeren Chen 2, 3(某大学) ; Xuhao Hu 2, 4(某大学) ; Yijin Zhou 2(某大学) ; Weichen Zhang 2(某大学) ; Dongrui Liu 2(某大学) ; Lu Sheng 3(某研究所) ; Jing Shao 2(某研究所)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 IS-Bench通过多模态基准评估视觉语言模型驱动的具身智能体在日常家务任务中的交互安全性,揭示现有智能体缺乏安全意识的问题。
当拒绝失效时:长上下文LLM代理中的不稳定安全机制
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究发现长上下文LLM代理在性能和拒绝率上存在不稳定安全问题,揭示了评估长多步骤任务代理安全性的挑战。
Comments 12 pages, 11 figures. Accepted at AAAI 2026 TrustAgent Workshop
RealWebAssist: 一个用于长周期网页协助的基准测试
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 RealWebAssist是一个评估长周期网页协助中连续指令遵循能力的新基准测试,旨在解决现实世界中用户指令模糊性和动态性带来的挑战。
Comments Project Website: https://scai.cs.jhu.edu/projects/RealWebAssist/ Code: https://github.com/SCAI-JHU/RealWebAssist
OceanGym: 一个用于水下具身智能体的基准环境
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。
Comments Work in progress
规范性主动推断:一种计算和经济法律分析方法用于AI治理的数值原理证明
专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract)
AI总结 本文提出通过设计监管实现合法且规范敏感的AI行为,利用主动推断框架模拟自动驾驶场景,展示法律规范对AI代理决策的影响。
Comments 19 pages, 6 figures, 1 box
机构 * Waseda University(早稻田大学) ; CyberAgent, Inc.(CyberAgent公司) ; AI Shift, Inc.(AI Shift公司) ; Nara Institute of Science and Technology(奈良研究所)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG
Comments AAAI 2026
机构 * Youtu-LLM Team, Tencent Youtu Lab(腾讯优设实验室) ; Sun Yat-sen University(中山大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.SE
机构 * Algoverse ; Microsoft
专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI、cs.LG、cs.SE
Comments Accepted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Multi-Turn Interactions in Large Language Models
Journal ref Neural Information Processing Systems (NeurIPS 2025)
机构 * University of Minnesota(明尼苏达大学) ; Texas A&M University(德克萨斯农工大学) ; CISCO Research(思科研究)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG
机构 * SKLCCSE, Beihang University(北京航空航天大学智能科学与技术研究中心) ; Zhongguancun Laboratory(中关村实验室) ; The University of Sydney(悉尼大学) ; Henan University of Science(河南科技大学)
专题命中 Agent评测 :agent(abstract);planning(abstract);workflow(abstract)
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Northeastern University(东北大学)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments 27 pages, 6 figures, 2 tables
机构 * Department of Electrical and Computer Engineering, University of Waterloo(电气与计算机工程系,滑铁卢大学)
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments 9 pages, 4 figures, 4 tables
机构 * McMaster University(麦斯特大学) ; McMaster Centre for Software Certification(麦斯特软件认证中心)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG、cs.SE
Comments Accepted for ACM/IEEE MODELS'25
机构 * Delft University of Technology(代尔夫特理工大学)
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)
Comments Manuscript under review
机构 * Meta ; University of Edinburgh(爱丁堡大学)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
机构 * Intuit AI Research(Intuit AI研究院)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments ACL 2025; 18 pages, 8 figures