Unified continuous-time q-learning for mean-field game and mean-field control problems
面向平均场博弈与平均场控制问题的统一连续时间Q学习方法
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文针对环境模拟器无法直接获取群体分布的场景,提出解耦Iq函数,设计统一参数化Q学习算法,验证其在MFG与MFC学习任务中的有效性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
面向平均场博弈与平均场控制问题的统一连续时间Q学习方法
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文针对环境模拟器无法直接获取群体分布的场景,提出解耦Iq函数,设计统一参数化Q学习算法,验证其在MFG与MFC学习任务中的有效性。
Frontis-MA1:训练AI4AI模型以实现机器学习工程中的递归自我改进
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 该研究推出面向MLE中RSI研究的开源全栈系统OpenMLE,后训练Frontis-MA1(35B)作为元进化智能体,在多个基准测试中提升性能,相关模型与系统已开源。
选择性可信度受限的信念更新
机构 * University of the Peloponnese(伯罗奔尼撒大学) ; American University of the Middle East(中东美国大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文针对现有可信度受限信念更新无法处理复合认知输入部分可实现的问题,提出选择性可信度受限的信念更新,刻画其语义与公理,定义两类子类,证明框架通用性,提供统一且表达力更强的信念更新方案。
因果关系在算法追索中的作用
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Vector Institute(向量研究院) ; Drexel University(德雷塞尔大学) ; Leiden University(莱顿大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本研究针对算法追索仅关注翻转模型预测的缺陷,提出因果表演框架建模追索行动的因果传播,实验显示其优于标准方法并减少模型重训需求。
Tycho:面向ARC-AGI-3的基于可编程世界模型的主动抽象
机构 * Dresden University of Technology(德累斯顿工业大学) ; Amazon(亚马逊) ; TIB – Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心) ; Leibniz University of Hannover(汉诺威莱布尼茨大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对ARC-AGI-3的交互式抽象问题,提出编码智能体系统Tycho,通过结构化观测构建游戏模型,选定策略下GPT-5.6 Sol与Opus 5可达成100%相对人类行动效率并完成全部关卡。
Comments 52 pages, 18 figures, 17 tables. Open-source implementation: https://github.com/NIMI-research/Tycho
基于世界模型的具身智能安全性:威胁、防御与评估的生命周期
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。
DataClawEval:面向真实工业场景的数据工程智能体基准测试
机构 * Tencent(腾讯) ; Xidian University(西安电子科技大学) ; South China Normal University(华南师范大学)
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI
AI总结 DataClawEval是首个针对真实工业数据工程场景的智能体基准,含100项跨5种引擎的任务,用确定性脚本评分,评估16个前沿智能体发现最强模型仅得74.9分,自主数据工程仍是挑战。
Rehearse:从自改进自动研究中的置信度悬崖后退
机构 * Tencent(腾讯)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究发现自动研究中存在置信度悬崖问题,提出Rehearse方法通过聚焦过往尝试结果记忆提升判断准确率,在三个任务的4000次训练运行预算下改善了终点性能。
大语言模型能否解决真实的Java合并冲突?一项使用校准后的LLM作为评判者的评估
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 该研究针对真实Java合并冲突,构建仅用推理信号的LLM求解器,经校准的LLM评判者评估发现,其解决冲突的覆盖和匹配开发者方案的表现优于传统工具AutoMerge,但结构正确性仍需确定性检查保障。
面向视觉语言赋能的无人机分类与灾害响应的系统工程框架
机构 * University of Arkansas(阿肯色大学) ; University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究提出将视觉语言模型(VLMs)作为协同智能体嵌入人-无人机回路的系统工程框架,经评估可降低人因负担、提升AI信任度,推进了高风险灾害响应的人-自主系统协同。
Comments 10 pages, 8 figures. Author accepted manuscript of AIAA Paper 2026-4010, published in the AIAA AVIATION 2026 Forum
Journal ref AIAA AVIATION 2026 Forum, AIAA Paper 2026-4010, 2026
PAUSE:统一服务环境中面向用户的个人AI助手基准测试
机构 * University of Alberta(阿尔伯塔大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究人员针对现有个人AI助手基准测试的缺陷,提出PAUSE基准测试,采用多机制评估框架,实验发现现有先进模型在相关场景任务完成率不足70%,还提出可扩展生成任务的合成流水线。
AgentS4D:基于大语言模型的工作空间智能体执行生命周期内运行时风险基准
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 研究推出AgentS4D基准,评估20种智能体配置在328个风险案例中的表现,发现任务完成不代表安全,需跨风险条件完整评估智能体配置。
FAVA:基于证据支持的权限图的经验证智能体的形式化授权
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。
高效有限反馈下的在线符合选择
机构 * Google Research(谷歌研究) ; Department of Computer Science, Duke University(杜克大学计算机科学系)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出一种在有限反馈下高效实现在线符合选择的方法,通过适应性符合推断更新规则,在保证目标概率下实现亚线性效率 regret,适用于带隙和半带隙反馈场景。
连续时间强化学习用于多 regime 最优化切换
机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学) ; School of Mathematics and Statistics, University of Sydney(数学与统计学学院,悉尼大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出了一种基于连续时间强化学习的多 regime 最优化切换方法,通过熵正则化和马尔可夫链生成矩阵实现策略优化,并利用神经网络验证了算法有效性。
Comments Keywords: Optimal regime switching, continuous-time reinforcement learning, system of HJB equations, policy improvement, policy iteration convergence, financial applications
PowerAtlas:面向电力系统的电-计算协同调度
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; State Grid Liaoning Electric Power Co., Ltd.(国网辽宁省电力有限公司) ; Nanyang Technological University(南洋理工大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 PowerAtlas是用于电-计算协同调度的LLM智能体框架,整合多类约束生成可行方案,构建含2000个实例的ECBench基准,在11种LLM上验证了有效性。
Comments 17 pages, 9 figures, 5 tables. Code: https://github.com/JAVA-Jiang/PowerAtlas
多样性约束下的参数化公平资源分配
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出PRA及自适应变体APRA框架,将多样性约束下的资源分配从硬性条件优化转为柔性参数调节,兼顾公平性与效率,在真实应用中性能优于现有基准。
\textsc{IH - 基准测试}:用于大语言模型应用中指令层次鲁棒性的以冲突为中心的基准测试
专题命中 Agent评测 :tool-use(abstract);分类 cs.SE
AI总结 研究大语言模型接收到不同优先级冲突指令时遵循哪个的问题,提出IH - 基准测试,基于人工分类法构建,用统一协议评估,涵盖多种设置。通过对37个模型评估发现指令层次鲁棒性非单一能力,需多方面评估。
FilmBench:用于电影视频生成的电影级基准测试
机构 * Alibaba Group(阿里巴巴集团) ; Moku Lab, Hujing Digital Media & Entertainment Group(魔氪实验室,虎鲸数字媒体与娱乐集团) ; Beijing Film Academy(北京电影学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 FilmBench是基于电影学院传统专业电影语言开发的文本到视频和参考到视频基准测试。它从获奖影片反向设计提示,依电影分类法评估,开发自动评估代理并开源核心套件,能再现人类模型排名,指出当前模型在动态美学等方面不足。
SkillCAT: 面向LLM智能体的对比评估与拓扑感知技能自进化
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Computer Science, Fudan University(复旦大学计算机学院)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 提出SkillCAT框架,通过对比因果提取、评估增强进化和拓扑感知任务执行三阶段,实现无需训练的LLM智能体技能自进化,在多个基准上平均提升高达40.40%。
Comments 9 pages, 4 figures
VideoFDB: 评估对话代理中的全双工视觉-语音能力
机构 * NVIDIA ; David AI
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 提出首个全双工视听到视听(AV2AV)对话基准VideoFDB,通过237个真实视频片段、感知与生成行为分类以及基于评分规则的LM评判框架,系统评估代理在非语言对话动态中的表现,发现现有系统存在字幕崩溃和视觉流忽视等缺陷。
Comments Project page: https://research.nvidia.com/labs/amri/projects/video-fdb/
TabPFN扩展在可解释地质建模中的应用
机构 * Department of Civil and Environmental Engineering, Tohoku University(东北大学土木环境工程系) ; Research Organization of Information and Systems, The Institute of Statistical Mathematics(信息与系统研究所统计数学研究所) ; Department of Statistical Science, The Graduate University for Advanced Studies(高级研究大学统计科学系)
专题命中 Agent评测 :workflow(abstract);分类 cs.LG
AI总结 本文评估了TabPFN及其扩展库在地质任务中的表现,通过土壤类型分类和参数迭代填补,展示了TabPFN在不确定性量化和可解释性方面的优势。
Journal ref Georisk: Assessment and Management of Risk for Engineered Systems and Geohazards (2026) 1-20
对齐目标问题:人类、人工智能系统及其设计者的道德判断分歧
机构 * The University of Hong Kong(香港大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究探讨了人类、AI系统及其设计者在道德判断上的差异,通过实验发现人类设计的AI行为会引发更强烈的道德约束,揭示了价值对齐的挑战。
Comments ACM FAccT 2026
面向情感的提示方法用于共情LLM辅导
机构 * Neurosciences Graduate Program, University of California San Diego(加州大学圣地亚哥分校神经科学研究生项目) ; Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) ; Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系) ; Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) ; Department of Mathematics, University of California San Diego(加州大学圣地亚哥分校数学系) ; Face the FACS ; Halıcıoğlu Data Science Institute, University of California San Diego(Halıcıoğlu数据科学研究所)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文研究了在LLM辅导中整合面部表情信号以提升共情响应的效果,通过四种不同方法对比发现,基于动作单元的条件化能提升对面部表情的共情响应,而引导峰值帧选择优于随机帧输入。
规范性人工智能:一种用于在不确定性下审计人类决策的正式范式
机构 * Institute of Computing, Universidade Federal Fluminense (UFF)(联邦弗鲁米嫩塞大学计算研究所)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出规范性人工智能作为高风险环境下的人类-人工智能决策协作范式,通过四个公理证明了其与预测系统的核心区别,并展示了在决策模仿中系统性偏差的限制。
Comments Preprint; suitable for AI, decision sciences, and prescriptive analytics. Short versions published in Wharton Sports Analytics Journal Fall 2025 (AI Feature Spotlight) and accepted to AAAI Bridge on LM Reasoning 2026
超越认知:认知分裂症与作为技术符号机器的大语言模型
机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI
AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。
CogEEGAgent:通过基于执行和选择感知验证实现自主认知脑电图分析
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究针对认知EEG分析需专业知识及选择多的问题,提出基于MNE-Python的CogEEGAgent代理,LLM解释意图,确定性组件验证控制,在基准测试等中表现良好,建立了有限自主性和可审计自动化框架。
Comments 16 pages, 5 figures, and 16 tables. The supplementary material is included in the same PDF
Picasso: 基于物理约束采样的整体场景重建
机构 * Massachusetts Institute of Technology(麻省理工学院) ; National University of Singapore(新加坡国立大学)
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 提出Picasso,一种通过快速拒绝采样推理多物体交互并考虑几何、非穿透和物理约束的整体场景重建方法,在物理合理性和重建精度上显著优于现有技术。
Comments 15 pages, accepted to Robotics: Science and Systems (RSS) 2026
在启发式自我改进智能体中自我编写的验证不可靠
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 研究启发式自我改进智能体中自我编写验证不可靠的问题,引入密封外部接受循环(SEAL)方法,通过实验发现该问题在启发式学习中常现,自我验证失败按能力分层,SEAL性能优于无保护基线。
Comments 9 pages, 6 figures
用于心理健康的金融数字表型分析的计算伦理框架
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对人工智能驱动数字表型系统伦理治理难题,提出计算伦理框架,将伦理要求形式化为道义时态逻辑约束,通过金融数据和心理健康案例研究,用Z3求解器建模验证关键伦理属性,实现持续机器可验证伦理检查,支持相关系统发展。
Comments Accepted at the CIBB 2026 conference (https://cibb2026.teralab.ai/)