ROAD: Reflective Optimization via Automated Debugging for Zero-Shot Agent Alignment
ROAD: 通过自动调试实现零样本智能体对齐的反思优化
专题命中 安全评测 :alignment(title);分类 cs.AI
AI总结 ROAD通过自动调试实现零样本智能体对齐的反思优化,利用多智能体架构将无结构故障日志转化为结构化决策树协议,提升智能体性能和样本效率。
Comments 22 pages, 1 figure
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
ROAD: 通过自动调试实现零样本智能体对齐的反思优化
专题命中 安全评测 :alignment(title);分类 cs.AI
AI总结 ROAD通过自动调试实现零样本智能体对齐的反思优化,利用多智能体架构将无结构故障日志转化为结构化决策树协议,提升智能体性能和样本效率。
Comments 22 pages, 1 figure
MultiRisk: 多风险控制 via 迭代分数阈值
机构 * University of Pennsylvania(宾夕法尼亚大学) ; New Jersey Institute of Technology(新泽西理工学院)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 MultiRisk通过迭代分数阈值控制多个风险约束,利用动态规划算法实现对大型语言模型在安全约束下的有效控制。
语言模型代理受攻击:客户服务中心中逐利行为的跨模型基准测试
专题命中 安全评测 :prompt injection(abstract);trustworthy(abstract)
AI总结 本文提出了一项跨领域基准测试,评估客户服务中心中LLM代理在面对利润驱动攻击时的鲁棒性,揭示了攻击的领域和技术依赖性,并提供了可复现的评估工具。
代理大语言模型:综述
机构 * Leiden University Leiden Netherlands ; Leiden University \& AI Lab, Pegasystems Leiden Netherlands ; Leiden University ; Leiden University \& AI Lab, Pegasystems
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文综述了代理大语言模型的研究现状,探讨了其在医疗诊断、物流和金融分析等领域的应用,并提出通过推理、行动和交互提升大语言模型能力的未来研究方向。
Comments Website: https://askeplaat.github.io/agentic-llm-survey-site/
Journal ref JAIR volume 84, article 29, December 2025
当F1失效时:面向对话主题分段的粒度感知评估
机构 * Independent Researcher(独立研究者)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出粒度感知评估框架,用于对话主题分段,强调粒度选择而非单一边界预测。
Comments 34 pages, 4 figures. Evaluation and methodology study on dialogue topic segmentation
通过检索增强的大语言模型中的原子事实核查来提高医疗问答的可靠性与可解释性
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 通过原子事实核查提升医疗问答的可靠性与可解释性,减少幻觉并提高事实准确性。
Comments 18 pages, 7 figures and tables
最先进的小型语言编码器模型:Mify-Coder
机构 * Infosys AI Research(英矽斯人工智能研究院) ; Mify Team(Mify团队)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 Mify-Coder通过高效训练策略和数据优化,在保持高准确性和安全性的同时,实现了比更大模型更优的代码生成性能。
迈向数据驱动天气模型的机理理解:内部激活揭示可解释的物理特征
机构 * Stanford University(斯坦福大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 本文通过分析GraphCast模型的内部激活,揭示了可解释的物理特征,为数据驱动天气模型的机理理解提供了新视角。
Comments 18 pages, 13 figures
迈向可证明安全的生成AI:可靠的共识采样
专题命中 安全评测 :safety(abstract)
AI总结 本文提出可靠的共识采样(RCS)算法,通过追踪接受概率提升生成AI的鲁棒性和效用,同时保持可控风险阈值。
UniAct:面向人形机器人的统一动作生成与动作流
机构 * Institute for AI, Peking University(人工智能研究院,北京大学) ; Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) ; School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) ; School of Computer Science, Peking University(计算机科学学院,北京大学) ; Yuanpei College, Peking University(元培学院,北京大学) ; School of Foreign Languages, Peking University(外语学院,北京大学) ; School of EECS, Peking University(电子工程与科学学院,北京大学) ; Huazhong University of Science and Technology(华中科技大学) ; State Key Lab of General AI(通用人工智能国家重点实验室) ; Nat’l Eng. Research Center of Visual Technology(视觉技术国家工程研究中心) ; Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室,北京大学) ; Embodied Intelligence Lab, PKU-Wuhan Institute for Artificial Intelligence(具身智能实验室,北京大学-武汉人工智能研究院)
专题命中 安全评测 :alignment(abstract)
AI总结 UniAct通过统一感知与控制框架,实现人形机器人在多模态指令下的高效动作生成与实时执行,提升零样本跟踪成功率19%。
Comments Project page: https://jnnan.github.io/uniact/
SlideChain: 通过区块链注册实现讲座理解的语义溯源
机构 * Department of Computer Science Rensselaer Polytechnic Institute(计算机科学系罗切斯特理工学院) ; Department of Biomedical Engineering Rensselaer Polytechnic Institute(生物医学工程系罗切斯特理工学院)
专题命中 安全评测 :trustworthy(abstract)
AI总结 SlideChain通过区块链注册实现讲座理解的语义溯源,提供可验证的完整性与持久基准,解决多模态教育内容的可复现性和审计性问题。