Shutdownable Agents through POST-Agency
通过后代理实现可关闭的智能体
机构 * OpenAI
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出后代理建议,训练智能体满足仅在等长轨迹间的偏好,证明此与其他条件蕴含中立性+,使智能体可关闭且有用。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
通过后代理实现可关闭的智能体
机构 * OpenAI
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出后代理建议,训练智能体满足仅在等长轨迹间的偏好,证明此与其他条件蕴含中立性+,使智能体可关闭且有用。
当用户满意但智能体出错:工具增强对话的多维度评估
机构 * AWS AI Labs(AWS人工智能实验室) ; University of Pittsburgh(匹兹堡大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 针对工具增强对话系统中用户满意但智能体错误的问题,提出TRACE基准,通过系统合成多样错误案例,评估现有框架发现性能远未理想。
Comments The Fifth Generation, Evaluation & Metrics Workshop (GEM) at ACL 2026
使用潜在空间生成世界模型减轻自动驾驶模仿学习中的协变量转移
机构 * NVIDIA
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 提出用潜在空间生成世界模型解决自动驾驶协变量转移问题,训练时利用世界模型减轻该问题,无需大量训练数据,还引入新感知编码器,实验显示相比之前有显著改进。
Comments 8 pages, 6 figures, original September 2024, accepted at ICRA 2025 Workshop "Robots in the Wild", for associated video file, see https://youtu.be/7m3bXzlVQvU
具有行为潜变量的可控模拟智能体
机构 * Purdue University(普渡大学) ; University of Tokyo(东京大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 提出可控神经变分智能体(CNeVA),通过闭环共轭变分更新推断行为潜变量,结合修正流轨迹生成器,实现可解释轴上的可控模拟,在Waymo数据集上达到竞争性真实感并提供通道级可控性。
Comments 23 pages, 5 tables, 8 figures
认证世界模型作为感知时钟:主动感知的漂移感知截止时间
机构 * Hongbo Wang(王Hongbo)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 提出一种基于认证世界模型的感知时钟,通过漂移感知的截止时间规则决定主动感知时机,在合成基准和3D VN-JEPA模型上验证了有效性。
Comments 15 pages, 3 figures, 6 tables. Preprint
KernelSight-LM: 一种内核级LLM推理模拟器
机构 * Amazon Web Services(亚马逊网络服务) ; Boston University(波士顿大学)
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 提出KernelSight-LM,一种细粒度推理模拟器,通过分解服务步骤为屋顶线内核模型、通信模型和主机开销模型,并集成前缀缓存和连续批处理,实现跨GPU代际或少量目标数据下的精确延迟预测,支持硬件/软件协同设计。
LuxEmo:卢森堡语表达性文本转语音语料库
专题命中 Agent评测 :workflow(abstract);分类 cs.CL
AI总结 针对低资源语言卢森堡语,提出LuxEmo语料库(21小时,4种情感),采用半自动策展流程,并基准测试五种表达性TTS系统。
Comments 7 pages, 4 figures, under review
预印本:迈向人工通用智能的范畴论比较框架
机构 * Cognodata R+D & Universidad Autonoma de Madrid(Cognodata研发与马德里自治大学) ; University of California San Diego(加利福尼亚大学圣迭戈分校)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文旨在构建一个通用的范畴论框架,用于描述、比较和分析不同的人工通用智能架构,揭示其共同点与差异,并指导未来研究。
Comments 37 pages, 7 figures, 1 table
PPTArena: 一个用于PowerPoint编辑的基准测试
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出PPTArena基准,包含2125张幻灯片的1300+人工编辑任务,并设计PPTPilot智能体通过结构感知的规划-编辑-验证循环,在复合、布局敏感和跨幻灯片编辑上超越强基线10个百分点以上。
Comments ECCV 2026
从结构方程模型到双机器学习:基于调查研究的鲁棒性分析
机构 * School of Business, Law, Humanities and Pathways(商学院、法律、人文与路径学院)
专题命中 Agent评测 :workflow(abstract);分类 cs.LG
AI总结 提出一个分阶段鲁棒性分析框架,结合SEM、OLS和双机器学习,通过FinTech数字客户亲密调查模型验证,识别稳定与需谨慎解释的关系,并提供可复现模板。
Comments 21 pages, 1 figure, 13 tables
PHREEQC-MCQ-200:用于工具增强型科学模拟智能体的诊断基准
机构 * University of California, Riverside(加州大学河滨分校) ; University of California, Irvine(加州大学尔湾分校)
专题命中 Agent评测 :tool use(abstract);分类 cs.AI
AI总结 提出PHREEQC-MCQ-200基准,评估工具增强型智能体在地球化学模拟中的表现,发现模拟器访问显著提升准确率但存在非单调性,输出访问协议影响性能。
Comments 30 pages, 2 figures
从整体评估到结构化标准:大语言模型演变中的评分准则
机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) ; Department of Computer Science and Technology, Institute for AI(计算机科学与技术系,人工智能研究院)
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.CL
AI总结 本文提出评分准则作为统一框架,通过分解整体判断为可验证维度、提供过程级反馈和动态涌现自模型行为三个层次,连接人类意图与机器行为。
使用强化学习方法对自行车模型进行路径跟随与稳定化
机构 * Department of Mechatronics, University of Innsbruck(因斯布鲁克大学机电工程系) ; Department of Biomechanical Engineering, Delft University of Technology(代尔夫特理工大学生物力学工程系)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出一种基于强化学习的路径跟随与稳定化方法,通过虚拟自行车模型在复杂路径上实现稳定控制,采用PD控制器将转向角度转换为转向力矩,通过课程学习策略优化性能。
基于参考的口语对话系统韵律与节奏评估
机构 * Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系) ; Amazon Inc.(亚马逊公司)
专题命中 Agent评测 :AI agent(abstract);分类 cs.CL
AI总结 针对语音到语音AI代理缺乏可解释的韵律与节奏评估指标,提出基于匹配参考的百分位评估协议,利用4000+小时对话数据构建参考层,有效减少误报并提高可解释性。
什么驱动了来自反馈的交互式改进?
机构 * University of Warsaw(华沙大学) ; AKCES NCBR ; Princeton University(普林斯顿大学) ; Mistral AI ; Institute of Mathematics, Polish Academy of Sciences(波兰科学院数学研究所)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 通过受控的学生-教师协议,分离反馈、重试和格式修正对多轮语言智能体性能提升的影响,发现有用反馈必须提供超越通用重试的指导,且学生利用反馈的能力是交互改进的关键瓶颈。
Comments 9 pages, 7 figures, accepted to the RLxF Workshop at ICML 2026
基于人工智能的物联网安全服务提供解决方案
机构 * Department of Electrical, Computer and Biomedical Engineering, University of Pavia(帕维亚大学电气、计算机与生物医学工程系) ; Department of Computer Applications, Cochin University of Science and Technology(科钦科技大学计算机应用系)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出一种结合深度强化学习和联邦学习的框架,用于在物联网环境中选择可靠智能对象并监控其行为,以增强服务提供的安全性。
TS-Haystack:一种用于长上下文时间序列推理的多任务检索基准
机构 * Agentic Systems Lab, ETH Zurich(1 非常规系统实验室,苏黎世联邦理工学院) ; Stanford University(2 斯坦福大学) ; Traffic Engineering Group, Institute for Transport Planning and Systems, ETH Zurich(3 交通工程组,交通规划与系统研究所,苏黎世联邦理工学院) ; University of Illinois Urbana-Champaign(4 印第安纳大学厄巴纳-香槟分校) ; Google(5 谷歌) ; Centre for Digital Health Interventions, ETH Zurich(6 数字健康干预中心,苏黎世联邦理工学院) ; Centre for Digital Health Interventions, University of St. Gallen(7 数字健康干预中心,圣加尔登大学)
专题命中 Agent评测 :agentic(abstract);分类 cs.LG
AI总结 本文提出TS-Haystack基准,评估长上下文时间序列推理能力,发现现有TSLMs存在长上下文退化问题,代理检索框架在9/10任务中表现优异。
Comments Workshop version of this paper published at ICLR TSALM 2026. Benchmark generation code and datasets: https://github.com/AI-X-Labs/TS-Haystack
人类创造力基准
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Contra
专题命中 Agent评测 :workflow(abstract);分类 cs.AI
AI总结 提出人类创造力基准(HCB),通过收集领域专家的成对偏好、标量评分和定性理由,分离收敛(共享最佳实践)和发散(个体品味差异)信号,评估创意AI。
Comments 30 pages
Dynamo: 视觉-语言代理的动态技能-工具演化
机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) ; Alibaba Zhejiang University(阿里巴巴浙江大学) ; University of Waterloo(多伦多大学) ; Vector Institute(向量研究所) ; Nanjing University(南京大学) ; Binjiang Institute of Zhejiang University(浙江大学滨江学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出Dynamo,一种无需训练、无需权重更新的框架,通过让冻结的VLM在少量标注数据上自我检查并演化可复用的推理技能和可执行的视觉工具,提升视觉推理性能。
AI训练管理器:自适应训练配方的有界闭环控制
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出一种基于LLM的有界监督控制器,通过结构化遥测和约束动作空间,动态调整学习率、正则化等超参数,解决训练中的过拟合、损失不平衡等问题,在语言建模和强化学习任务中提升性能。
Comments 12 pages, 9 figures
改进的多维预测以实现交换遗憾
机构 * Cornell University(康奈尔大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 针对未知目标的多个下游代理,提出一种预测器,同时保证所有代理的次线性交换遗憾,在二维空间中实现多项式时间算法,遗憾界为$\tilde{O}(\sqrt{kT})$,并推广到低维和高维环境。
Comments Accepted for presentation at the ACM Conference on Economics and Computation (EC) 2026
超级马里奥兄弟中的强化学习:世界1-1的课程、教学法与最优关卡设计
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 通过强化学习算法验证超级马里奥兄弟世界1-1的关卡设计具有教学结构,蒙特卡洛方法表现最佳,且规范顺序学习效率最高。
Comments 13 pages, 7 figures, 5 tables
构建面向空间生命科学、航空航天医学和深空探测的AI就绪数据系统
机构 * Blue Marble Space ; Computational and Systems Biology(计算与系统生物学) ; Trivedi Institute for Space and Global Biomedicine(Trivedi空间与全球医学研究所) ; Wellcome Sanger Institute(Wellcome桑格研究所) ; University of Cambridge(剑桥大学) ; Department of Systems Biology, Harvard Medical School(哈佛医学院系统生物学系) ; Amentum, Space Biosciences Division, NASA Ames Research Center(Amentum空间生物学 division, NASA Ames研究中心) ; Massachusetts Institute of Technology(麻省理工学院) ; Crown Point Technologies, Inc(Crown Point Technologies公司) ; BiosView Labs ; Directorate of Human and Robotic Exploration, European Space Agency(欧洲航天局人类和机器人探索部门) ; Texas State University(德克萨斯州立大学) ; McGowan Institute for Regenerative Medicine, Department of Surgery, University of Pittsburgh School of Medicine(McGowan再生医学研究所,匹兹堡大学医学院外科系) ; Center for Space Biomedicine, Trivedi Institute for Space and Global Biomedicine(空间生物医学中心,Trivedi空间与全球医学研究所) ; Department of Bioengineering, University of Pittsburgh(匹兹堡大学生物工程系) ; Stanley Center for Psychiatric Research, Broad Institute of MIT and Harvard(Stanley精神医学研究中心,MIT和哈佛Broad研究所) ; Department of Systems and Computational Biomedicine and WorldQuant Initiative, Weill Cornell Medicine(系统与计算生物医学系及WorldQuant计划,Weill Cornell医学院) ; San Diego Supercomputer Center, University of California San Diego(圣地亚哥超级计算机中心,加州大学圣地亚哥分校) ; Weill Institute for Neurosciences, Department of Neurology, University of California San Francisco(Weill神经科学研究所,加州大学旧金山分校神经病学系) ; Science for Life Laboratory, Department of Gene Technology, KTH Royal Institute of Technology(Science for Life实验室,基因技术系,皇家理工学院) ; European Molecular Biology Laboratory, European Bioinformatics Institute (EMBL-EBI)(欧洲分子生物学实验室,欧洲生物信息研究所(EMBL-EBI))
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对空间生物学数据异构性阻碍AI应用的问题,提出从FAIR到AI就绪再到空间就绪的三层数据架构,并建议建立国际协调机构以支持深空生物学研究。
Comments 26 pages, 3 figures, 1 table, 1 supplementary table
探索纠缠对病原体表位-受体结合量子机器学习的影响
机构 * Vaccine and Infectious Disease Organization (VIDO)(疫苗与传染病组织) ; University of Saskatchewan(萨斯喀彻温大学) ; Faculty of Applied Science, University of Toronto(多伦多应用科学学院) ; Department of Mathematics and Statistics, University of Saskatchewan(萨斯喀彻温大学数学与统计学系) ; Centre for Quantum Topology and Its Applications (quanTA)(量子拓扑及其应用中心) ; Department of Computer Science, University of Saskatchewan(萨斯喀彻温大学计算机科学系) ; Advanced Research Computing, University of Saskatchewan(萨斯喀彻温大学高级研究计算中心) ; Vaccinology and Immunotherapeutics Program, School of Public Health, University of Saskatchewan(疫苗学与免疫治疗计划,公共卫生学院,萨斯喀彻温大学) ; Nord quantique(北量子)
专题命中 Agent评测 :workflow(abstract);分类 cs.LG
AI总结 研究特征映射阶段两量子比特纠缠门的数量和拓扑结构如何影响混合量子神经网络在猪繁殖与呼吸综合征疫苗设计中表位-受体结合分类的性能,发现高纠缠ZZ特征映射能减少训练过拟合。
Comments 15 pages, 8 figures, 3 tables
立场:强化学习研究者需要区分解决模拟器和将模拟器作为代理使用
机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算科学系) ; Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文主张强化学习研究者应明确区分两种模拟器使用场景:解决模拟器本身与将模拟器作为部署学习的代理,并分析两者在约束、算法和评估指标上的差异,避免误导性结论。
Comments This work has been accepted at the ICML 2026 position paper track. The peer reviewed reference is provided in the public OpenReview page at https://openreview.net/forum?id=KIobEIpCkp Additionally the publication can be seen at this link : https://icml.cc/virtual/2026/poster/67184
Journal ref ICML, 2026
零标签驾驶场景复杂度检测基于联合嵌入预测架构
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 提出无监督方法,利用联合嵌入预测架构(JEPA)在无标签数据上通过时间预测误差作为零样本复杂度指标,有效区分复杂与简单驾驶场景。
Comments 12 pages, 6 figures
面向混合模态异构企业数据源的对话式查询引擎
机构 * PayPal Artificial Intelligence(PayPal人工智能)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出COGNI系统,通过四层架构(索引、路由、检索、缓存)统一处理结构化与非结构化数据,实现高精度、低成本的混合模态查询。
Comments Accepted at Agent4IR @ KDD2026
SafeGEO:理解推荐代理中的生成引擎优化风险
机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; Department of Mechanical & Industrial Engineering, University of Toronto(多伦多大学机械与工业工程系) ; Faculty of Information, University of Toronto(多伦多大学信息学院) ; University of California, San Diego(圣地亚哥大学) ; ZBot Technology(ZBot技术) ; Coolwei AI Lab(Coolwei人工智能实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究GEO攻击如何使推荐代理推广有缺陷产品,提出SafeGEO评估套件,发现攻击使缺陷产品入选率提升83.2%,简单防御可降低39.2%但无法完全消除风险。
Comments 41 pages,23 figures
暂停与思考:面向视频基础辅助动作建议的数据集与基准
机构 * Advanced Micro Devices, Inc.(先进微器件公司)
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 提出 pause-and-think-T 数据集和 pause-and-think-B 基准,通过推理监督训练紧凑模型,在视频场景理解与目标规划任务中达到与大型模型相当的性能。
Comments Accepted in IROS 2026 (IEEE/RSJ International Conference on Intelligent Robots and Systems)
Ko-WideSearch: 面向网络代理的韩语广度搜索基准测试,用于穷举集合枚举
机构 * Upstage AI
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 提出韩语广度搜索基准Ko-WideSearch,通过自动化合成与验证流水线构建,评估网络代理在穷举集合枚举任务中的性能,发现代理在行级召回上显著不足。