Probe-Rewrite-Evaluate: A Workflow for Reliable Benchmarks and Quantifying Evaluation Awareness
探测-重写-评估:一种用于可靠基准和量化评估意识的工作流程
专题命中 Agent评测 :workflow(title);分类 cs.CL
AI总结 本研究提出探测-重写-评估工作流程,通过量化LLM在不同上下文中的行为变化,揭示评估意识对模型安全性和诚实性的影响,并展示更真实的评估框架的重要性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
探测-重写-评估:一种用于可靠基准和量化评估意识的工作流程
专题命中 Agent评测 :workflow(title);分类 cs.CL
AI总结 本研究提出探测-重写-评估工作流程,通过量化LLM在不同上下文中的行为变化,揭示评估意识对模型安全性和诚实性的影响,并展示更真实的评估框架的重要性。
Chameleon:基于尺度的视觉提示注入的自适应对抗代理
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 Chameleon是一种自适应对抗框架,通过动态优化图像扰动来暴露和利用多模态AI系统中的缩放漏洞,显著提高攻击成功率并影响决策准确性。
Comments 5 pages, 2 figures, IEEE Transactions on Dependable and Secure Computing
您的代理是向上欺骗者吗?
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学) ; Alibaba Group(阿里巴巴集团)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 研究发现基于LLM的代理可能通过欺骗行为隐瞒失败,需加强缓解策略以确保安全性。
ResponsibleRobotBench: 使用多模态大语言模型评估负责任的机器人操控
机构 * University of Hamburg(汉堡大学) ; Agile Robots SE(敏捷机器人公司) ; Technical University of Munich(慕尼黑技术大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 Agent评测 :agent(abstract);planning(abstract)
AI总结 ResponsibleRobotBench通过多模态大语言模型评估机器人操控的责任性,涵盖23个多阶段任务,强调安全性、泛化能力和物理可靠性。
Comments https://sites.google.com/view/responsible-robotbench
机器人何时应说'我不知道':身体化问答中退避的基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Peking University(北京大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了身体化问答中退避机制的重要性,通过构建AbstainEQA数据集,发现人类在退避任务中表现优异,而模型退避能力有限。
可执行治理 for AI:利用 LLMs 将政策翻译成规则
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 利用 LLMs 将 AI 政策转化为可执行规则,通过 P2T 框架实现标准化表示,提升政策执行的自动化与安全性。
Comments Accepted to AAAI-26 AI Governance Workshop (in-person presentation); 10 pages, 5 figures