Assessing Automated Prompt Injection Attacks in Agentic Environments
评估智能体环境中的自动化提示注入攻击
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 研究在智能体环境中,黑盒优化方法(TAP)比梯度方法(GCG)更有效,且攻击效果依赖于攻击者模型,任务通用攻击可迁移但跨模型迁移受限。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
评估智能体环境中的自动化提示注入攻击
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 研究在智能体环境中,黑盒优化方法(TAP)比梯度方法(GCG)更有效,且攻击效果依赖于攻击者模型,任务通用攻击可迁移但跨模型迁移受限。
PlanGPT的补充研究:使用定义性能指标评估并与规划器比较
机构 * Univ. Grenoble Alpes - LIG(格勒诺布尔阿尔卑斯大学 - 信息学实验室(LIG))
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文对大型语言模型PlanGPT进行补充实验,使用规划成本和生成时间两个指标评估其性能,并与传统规划器比较,发现PlanGPT并不优于贪心搜索策略。
Comments 7 pages
STAGE-Claw:面向真实场景的基于状态的智能体自动化基准测试
机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院) ; Chinese Academy of Sciences(中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; Meituan(美团)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出STAGE-Claw框架,自动构建基于状态的个人计算环境中的真实场景任务,通过最终系统状态而非文本响应评估智能体性能,创建40个挑战性任务并分析11个前沿模型。
FASE: 用于代码质量的快速自适应语义熵
机构 * University of Waterloo(滑铁卢大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出快速自适应语义熵(FASE),通过最小生成树近似功能正确性,在HumanEval和BigCodeBench上相比现有语义熵方法在Spearman相关性和ROCAUC上分别提升25%和19%,且计算开销仅为传统方法的0.3%。
现在你(仍然)能看到我:检测大语言模型中的隐蔽隐写载荷
机构 * UCL Centre for AI(UCL人工智能中心) ; University College London(伦敦大学学院) ; ML Alignment Theory Scholars(机器学习对齐理论学者) ; Department of Computer Science(计算机科学系) ; School of Computing and Communications(计算与通讯学院) ; ETH Zürich(苏黎世联邦理工学院) ; University of Sussex(Sussex大学) ; Imperial College London & University of Oxford(伦敦帝国学院与牛津大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 针对大语言模型隐写外泄风险,提出一种基于非线性MLP探针的对抗性微调方法可系统规避现有线性探针检测,但通过信息论指导的数据级干预可恢复检测能力。
通过自进化桥接专家知识与自动化特征工程
机构 * Adobe Media and Data Science Research(Adobe媒体与数据科学研究) ; IIIT-Delhi(德里印度理工学院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出FEST方法,结合双流特征生成、语义去重和树引导迭代进化,从原始文本和图像中发现可审计特征,在品牌分类等任务中平均提升4.2个百分点,并实现60-80%的专家特征覆盖。
RAILS: 面向代理商务的验证原生清算
机构 * Evolutionairy AI
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对自主代理在商务活动中缺乏中立清算机制的问题,提出RAILS协议,通过可靠性评分、记录和清算函数实现验证原生清算,确保财务结算基于充分证据。
Comments 49 pages, 15 figures
超越古德哈特定律:多智能体系统中合规性评估的动态基准
机构 * Fudan University(复旦大学) ; Shanghai Academy of AI for Science(上海人工智能科学研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Monash University(莫纳什大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对多智能体系统在压力下可能违反安全规则的问题,提出MAC-Bench动态对抗基准,通过SERV流水线生成无污染场景,并引入CSR和MG指标评估前沿模型的合规性。
评估RAG在干净、误导和混合检索下的可靠性
机构 * Ankara University(安卡拉大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出评估协议,通过参数覆盖和置信度指标,系统测试RAG系统在干净、有毒和混合证据下处理参数知识与检索证据冲突的鲁棒性。
AVI-Bench:迈向全模态大语言模型的人类级视听智能
机构 * Nanyang Technological University(南洋理工大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出AVI-Bench基准,通过感知、理解、推理三阶段跨模态任务评估全模态大语言模型的视听智能,并引入AVI-Bench-PriSe测试原始视听感知,揭示当前模型局限,构建四级AVI分类体系。
Comments 31 pages, 8 figures, ICML 2026
AI生成的社交机器人内容的对抗性创建与检测
机构 * Universitat Pompeu Fabra(庞培法拉大学) ; Observatory on Social Media, Indiana University(社交媒体观测站,印第安纳大学) ; KTH Royal Institute of Technology(皇家理工学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出对抗性方法模拟恶意用户冒充真人,构建多语言跨平台配对数据集,训练检测模型显著优于现有方法。
前所未见:基于一致视频源数据集的真正零样本组合图像检索基准测试
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对现有零样本组合图像检索数据集存在参考与目标图像不相关、非真正零样本的问题,提出ZeroSight基准,包含来自视频的一致参考-目标对和训练无关的MLLM驱动方法SC4CIR,通过三重对称一致性检查识别难负样本,实验表明现有方法性能被高估。
MADRAG: 基于检索增强生成的多智能体辩论用于免训练分析性论文评分
机构 * University of California, Irvine(加州大学尔湾分校)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL
AI总结 提出MADRAG框架,结合多智能体辩论与检索增强,通过倡导者、批评者和法官的交互以及检索示例校准,实现无需训练的论文评分,性能接近监督系统。
Comments 21 pages, 7 figures, 14 tables
开源权重模型能在金融文本理解领域与(闭源)模型竞争吗?
机构 * University of St. Gallen(圣加仑大学)
专题命中 评测与基准 :language model(abstract,comments);分类 cs.CL、cs.AI;large language model(comments)
AI总结 该研究更新了Financial Touchstone金融文本理解基准,测试了20款模型,发现开源权重模型Kimi K2.6准确率排第三,挑战了推理架构或闭源权重是金融理解前提的假设,还发现中国模型存在地缘政治内容过滤器拒绝合法金融问题的现象。
Comments To be presented at the workshop International Symposium on Large Language Models for Financial Services (FinLLM@IJCAI2026)
OccluRank:仅添加序数秩的可控遮挡感知布局到图像生成
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 提出OccluRank框架,仅添加序数秩实现可控遮挡感知布局到图像生成,构建相关数据集与基准,实验表明其能可靠保留实例、遵循布局并实现期望遮挡关系,性能相当。
Comments 16 pages, 7 figures. Code: this https URL (https://github.com/Wenyang-hong/OccluRank)
智能体集成开发环境(Agentic IDE)生成网页应用:一项实证评估
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本文通过对比Copilot、Cursor、Windsurf三款智能体IDE生成五个全栈网页应用的表现,发现其在生成常见模式时成熟度高,但生成分布式架构错误多,无法替代开发者,仅能辅助开发者构建软件。
AGIDefect-4K:用于AI生成图像缺陷检测、定位与解释的富标注数据集
机构 * Xidian University(西安电子科技大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文推出含4000张图像的AGIDefect-4K数据集,并提出基于多模态大语言模型的AGIDA基准框架,用于AGI缺陷检测、定位、解释及质量预测,凸显了AGI缺陷理解研究的价值。
Comments 8 pages, 6 figures. Accepted by ACM Multimedia 2026
面向人类购物行为的忠实模拟
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本文针对现有用户购物行为模拟器的记忆与优化挑战,提出分层记忆的RecVerse智能体,结合轨迹级RL优化,发布USB数据集,在模拟性能上显著优于现有基线。
从引用意图到知识贡献:对被引论文实际贡献的分类
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究提出知识贡献分类体系KCT及双路径融合模型,实现被引论文知识贡献分类,其准确率达85.5%,且在研究评估、学术传播预测中表现优于传统引用意图分类。
评估上下文协议(ECP):一种用于AI智能体评估的便携式契约
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 针对当前AI智能体评估范式的局限性,提出厂商中立的ECP协议,实现跨框架的统一评估,已开发适配主流智能体框架的开源参考实现,相关验证为未来工作。
Comments 14 pages, 4 tables, 4 figures, Code available at https://github.com/evaluation-context-protocol
用智能体机器人技术重新审视“Push-T”机器人操作任务
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 该研究在智能体机器人技术背景下,借助带Fable 5的Claude Code编码智能体,无需演示数据解决Push-T等机器人操作任务,其策略成功率达100%,步骤比基准扩散策略少46%,还支持多字母操作及跨实体机械臂仿真。
JANUS:面向无序材料的多模态基础神经采样器
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究人员开发JANUS多模态神经采样器,用于无序材料的热力学采样,其以远少于传统方法的能量评估次数重现平衡性质,可用于合金逆设计及半导体缺陷探索,为相关研究提供了基础。
JW-SSD:用于细粒度太阳黑子分类的多模态基准数据集
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究提出用于太阳黑子细粒度磁型分类的多模态基准数据集JW-SSD,经质量控制后含36553对图像,可用于训练多种模型,包括取得高准确率的JW-SunSpot。
Comments 15 pages, 3 figures
UniVerse:针对文化包容性低资源音乐理解的基准测试与增强
机构 * Sogang University(西江大学) ; KAIST(韩国科学技术院) ; NYU Shanghai(上海纽约大学) ; JIUTIAN Research, China Mobile(中国移动九天研究院) ; The State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) ; China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) ; Central Conservatory of Music(中央音乐学院)
专题命中 评测与基准 :language model(abstract,abstract_cn)
AI总结 该研究针对低资源音乐理解问题,推出UniVerse基准与数据集,训练LALMs并研究多模态不平衡学习策略,实现性能提升但仍存在深层音乐理解的差距。
Comments 21 pages, 7 figures, 8 tables
面向通用深度伪造检测的环境不变子空间学习
机构 * Tianjin University of Technology(天津理工大学) ; Shandong Artificial Intelligence Institute(山东人工智能研究院) ; Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))
专题命中 评测与基准 :foundation model(abstract,abstract_cn)
AI总结 该研究针对深度伪造检测中跨分布泛化瓶颈,提出EISL框架,通过低秩投影解耦特征并设计环境干预模块,在多设置实验中提升了对未见伪造类型和环境变化的鲁棒性。
Comments 12 pages, 4 figures, 11 tables
MANIGUARD:用于基于规范的机器人操作安全评估与改进的基准及数据集套件
机构 * Northwestern University(西北大学) ; Stanford University(斯坦福大学) ; William & Mary(威廉玛丽学院)
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本研究提出ManiGuard基准与数据集套件,针对机器人操作基础模型策略,通过含23000余次滚动的实验证实安全需独立于任务成功评估,微调可提升安全表现但仍存差距。
ORCA:基于可观测性的微服务故障程序修复
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。
KHiM-Mamba:通过隐藏状态调制将病理知识注入Mamba以用于 whole slide image(WSI)分析
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本研究提出KHiM-Mamba架构,通过将病理知识注入Mamba的选择性状态空间机制,解决纯视觉驱动的WSI分析问题,在4类任务的11个公共基准上取得最优性能。
AnchorScore:一种基于CLIP的多模态大语言模型(MLLM)标注难度诊断方法
机构 * School of Foreign Studies, Changsha University of Science and Technology(长沙理工大学外国语学院) ; School of Education, Hunan Agricultural University(湖南农业大学教育学院) ; School of Information and Intelligence, Hunan Agricultural University(湖南农业大学信息与智能科学学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文提出基于CLIP的AnchorScore,可低成本预先对类别按MLLM标注难度排名,在课堂行为、动作识别等数据上与MLLM准确率相关性高,可用于混合路由、提示消歧等场景。
Comments 37 pages, 7 figures, 12 tables
AI模型生命周期的用户侧:来自Keep4o运动的证据
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本研究以Keep4o运动为案例,通过分析X平台6万余条帖子,发现AI模型技术更迭未必是用户侧的有效替换,用户体验应纳入AI模型生命周期管理。
Comments 32 pages, 5 figures, 6 tables