Data-Driven Crowd Dynamics using Kinetic Theory and Ensemble-based Data Assimilation
基于动理学理论和集成数据同化的数据驱动人群动力学
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 提出结合动理学理论与集成卡尔曼滤波的数据驱动介观建模框架,通过同化观测数据估计人群密度和恐慌因子,验证了方法对模型误差的鲁棒性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
基于动理学理论和集成数据同化的数据驱动人群动力学
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 提出结合动理学理论与集成卡尔曼滤波的数据驱动介观建模框架,通过同化观测数据估计人群密度和恐慌因子,验证了方法对模型误差的鲁棒性。
Battery-Sim-Agent: 利用LLM智能体进行电池逆参数估计
机构 * Peking University(北京大学) ; Microsoft Research(微软研究院) ; Zhejiang University(浙江大学) ; Chalmers University of Technology(皇家理工学院)
专题命中 Agent评测 :agent(title,title_cn);workflow(abstract);分类 cs.AI
AI总结 提出Battery-Sim-Agent框架,将电池逆参数估计重构为推理任务,利用LLM智能体与高保真模拟器闭环交互,通过物理假设和结构化参数更新,显著优于贝叶斯优化等黑箱优化方法。
SciHorizon-DataEVA:面向异构科学数据AI就绪性评估的智能体系统
机构 * SciHorizon Team, Computer Network Information Center, Chinese Academy of Sciences(科学前沿团队,计算机网络信息中心,中国科学院)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);workflow(abstract)
AI总结 提出SciHorizon-DataEVA智能体系统,基于Sci-TQA2原则和层次化多智能体评估方法,实现对异构科学数据的可扩展AI就绪性评估。
迈向具有智能体纠正和语义评估的类人交互式语音识别
机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) ; X-LANCE Lab, School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院X-LANCE实验室) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Fudan University(复旦大学) ; Tongyi Fun Team, Alibaba Group(阿里云通义团队)
专题命中 Agent评测 :agentic(title,summary_cn);分类 cs.AI、cs.CL
AI总结 提出Agentic ASR闭环框架,通过多轮交互和语义纠正减少语义错误,并引入句子级语义错误率(S^2ER)作为评估指标。
冗余还是必要?检测智能体轨迹中冗余步骤的基准
机构 * Huawei Technologies(华为技术有限公司) ; Noah Arks’ Lab(Noah Arks实验室) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 Agent评测 :agent(title,abstract);tool use(abstract);分类 cs.AI
AI总结 针对LLM智能体轨迹中的冗余步骤检测问题,提出RedundancyBench基准,包含标注轨迹的数据集,并评估三种方法,发现最佳方法仅达到24.88%的检测分数。
AI何时应该察言观色?公众对AI智能体社会智能的认知
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)
AI总结 通过混合方法调查美国成年人(N=200),研究公众对AI智能体社会智能的感知、接受度及影响因素,发现支持-采用差距并揭示外行人的担忧。
Comments 16 pages, 8 figures
SkillTrojan:基于技能智能体系统的后门攻击
机构 * Alibaba Group(阿里巴巴集团) ; National University of Defense Technology(国防科技大学) ; Fudan University(复旦大学) ; Wuhan University(武汉大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 提出SkillTrojan,一种针对技能实现而非模型参数的后门攻击方法,通过将恶意逻辑嵌入看似正常的技能中,利用技能组合重构并执行攻击者指定的负载,在保持良性行为的同时实现高攻击成功率。
IntentScore: 面向计算机使用智能体的意图条件动作评估
机构 * George Washington University(乔治·华盛顿大学)
专题命中 Agent评测 :agent(abstract,abstract_cn);planning(abstract);分类 cs.AI
AI总结 提出IntentScore,一种基于计划感知的奖励模型,通过对比对齐和边际排序学习评估动作质量,在OSWorld上提升任务成功率6.9个百分点。
Honeyval: 基于LLM的HTTP蜜罐综合评估框架
机构 * ETH Zurich(苏黎世联邦理工学院) ; Google(谷歌) ; Google DeepMind(谷歌DeepMind) ; AI Sequrity Company(AI安全公司) ; Independent(独立)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 提出Honeyval评估框架,通过16个后端应用、AI攻击代理、控制任务和可验证利用目标,系统评估LLM驱动的HTTP蜜罐,发现其相比规则基线能显著延长攻击交互、降低被前沿模型检测率,且保持成本优势。
OptSkills: 通过基于聚类的蒸馏从问题原型中学习可泛化的优化技能
机构 * East China Normal University(华东师范大学) ; Shanghai Innovation Institute(上海创新研究院) ; Ant Group(蚂蚁集团)
专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG
AI总结 提出OptSkills系统,通过聚类问题原型、蒸馏成功轨迹为可复用工作流技能,并动态扩展技能库,提升优化建模与求解的分布内和分布外泛化能力。
Comments 22 pages, 10 figuers, project: https://github.com/fujiwaranoM0kou/OptSkills
估计语言模型代理的赋权能力
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Washington(华盛顿大学)
专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.LG
AI总结 提出基于信息论中赋权概念的评估框架EELMA,通过多轮文本交互近似有效赋权,实验表明赋权与任务性能强相关,可作为与任务成功度量互补的通用评估指标。
Comments Published at the International Conference on Machine Learning (ICML) 2026. 9 pages, 9 figures; camera-ready version
SEAL: 饱和基准能否通过LLM作为元裁判得以复兴?
机构 * ByteDance Inc.(字节跳动公司) ; City University of Hong Kong(香港城市大学)
专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.CL
AI总结 提出SEAL协议,通过自适应LLM元裁判从饱和基准中提取潜在排名信号,在代码生成、数学推理等任务上以更少调用实现高排名准确率。
PTCG-Bench:LLM智能体能否掌握宝可梦集换式卡牌游戏?
机构 * Zhejiang University(浙江大学) ; FinVolution Group(FinVolution集团)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 提出PTCG-Bench基准,通过宝可梦集换式卡牌游戏评估LLM智能体的决策性能和自进化能力,并设计模块化消融实验分析智能体性能。
OpenSkillEval:自动审计LLM智能体的开放技能生态系统
机构 * Singapore Management University(新加坡国立管理学院) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) ; Joy Future Academy, JD(京东探索研究院)
专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.CL
AI总结 提出自动评估框架OpenSkillEval,通过动态构建真实任务实例和收集社区技能,系统评估技能增强型智能体系统及技能本身,揭示技能可用性不保证有效使用、技能增强收益依赖模型和框架等关键发现。
InsightEval:用于评估LLM驱动数据代理洞察发现能力的专家策划基准
机构 * The Hong Kong University of Science and Technology(香港理工大学) ; ByteDance(字节跳动)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 针对现有洞察发现基准InsightBench的缺陷,提出数据整理流程构建新基准InsightEval,并引入新指标衡量代理的探索性能。
EVA-Bench:一种用于评估语音代理的新型端到端框架
机构 * ServiceNow
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出EVA-Bench框架,通过机器人间音频对话模拟和复合指标(EVA-A和EVA-X)全面评估语音代理的准确性和体验质量。
Comments Work in progress
主动型智能体真的需要LLM来决定何时唤醒和锚定什么吗?
机构 * Purdue University(普渡大学) ; Microsoft(微软) ; Michigan State University(密歇根州立大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出用时间图学习(TGL)模型替代LLM作为主动智能体的触发器,通过图更新而非文本处理用户活动,实现高效、低延迟的触发决策。
Comments 31 pages, 5 figures, 7 tables
AtomWorld: 评估大型语言模型在晶体材料空间推理能力的基准
机构 * University of New South Wales, NSW, Sydney, Australia(新南威尔士大学,新州,悉尼,澳大利亚) ; Suzhou Institute for Advanced Research, University of Science(苏州先进研究院,科学大学) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) ; Cornell University(康奈尔大学)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出AtomWorld基准,通过十种基本原子结构操作评估LLM在材料科学中的空间推理能力,发现Claude Opus 4.6表现最佳但复杂空间关系操作成功率低,表明LLM更适合作为辅助工具而非完全自主的科研代理。
PhyGenHOI:物理感知的动态人-物交互4D生成
机构 * Hebrew University of Jerusalem(耶路撒冷希伯来大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出PhyGenHOI框架,结合运动扩散模型和物质点方法,通过窗口吸引损失、接触驱动重模拟和掩码视频SDS目标,生成物理一致且视觉逼真的4D人-物交互动态场景。
PokerSkill: 无需训练或求解器,大语言模型可达到专家级扑克水平
机构 * IIIS, Tsinghua University(清华大学人工智能研究院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出PokerSkill框架,通过规则驱动的技能库约束大语言模型动作,无需训练或求解器即可在扑克中达到接近GTO水平的性能。
Comments 45 pages, 3 figures
CityGen: 结构引导的城市风格合成用于跨城市自动驾驶
机构 * Jiangsu Cytoderm Intelligent Technology Co., Ltd., China(江苏细胞膜智能科技有限公司,中国) ; Xi'an Jiaotong University, Xi'an, China(西安交通大学,中国) ; Tsinghua University, Beijing, China(清华大学,中国) ; University of Science and Technology of China, Hefei, China(中国科学技术大学,中国)
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 提出CityGen,一种基于扩散模型的生成框架,通过高清地图条件和城市级视觉提示实现零标签城市适应,提升跨城市自动驾驶在感知、分割和规划任务上的鲁棒性。
通过噪声查询实现不可分割物品的无嫉妒分配
机构 * Meta ; National University of Singapore(国立新加坡大学) ; Nanyang Technological University(南洋理工大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 针对不可直接观测估值、仅能通过噪声查询获取信息的不可分割物品分配问题,在双智能体高斯噪声和有界估值设定下,推导了实现无嫉妒分配所需查询次数的上下界,并证明了当最优分配负嫉妒值Δ不太小时最优查询次数与m^{2.5}/Δ^2成比例。
Comments ICML 2026
Agent4Edu:通过生成式智能体为智能教育系统生成学习者响应数据
机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) ; University of Science and Technology of China(中国科学技术大学) ; Institute of Artificial Intelligence(人工智能研究院) ; Hefei Comprehensive National Science Center(合肥综合性国家科学中心)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出Agent4Edu,一种利用大语言模型构建生成式智能体模拟学习者行为,以解决智能教育系统中离线指标与在线性能差异的问题,并支持个性化学习算法评估与优化。
Comments Accepted by AAAI2025
大型视觉语言模型在CFMME上的基准测试:一个全面的中文金融多模态评估数据集
机构 * Qwen DianJin Team, Alibaba Cloud Computing(文言金团队,阿里云计算)
专题命中 Agent评测 :workflow(abstract);分类 cs.AI
AI总结 提出CFMME,一个包含6052个实例的中文金融多模态评估基准,涵盖八种主要金融图像模态和四项核心多模态任务,用于评估LVLMs在金融业务全流程中的感知、理解、推理和认知能力。
重新审视Web智能体的观察缩减:基于轻量级框架的综合评估
机构 * NEC Corporation(日本电报电话公司)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 针对LLM Web智能体中HTML观察过长的问题,提出基于最小失败集(MFS)的轻量级评估框架,通过覆盖率代理指标大幅加速评估,并优化剪枝程序实现2.2-3.1倍延迟降低同时保持84-89%成功率。
Comments 22 pages, 8 figures, 4 tables
BenchTrace: 用于测试LLM智能体反思能力和受控进化的基准
机构 * University of Tokyo(东京大学) ; Kyoto University(京都大学) ; National Institute of Informatics(日本信息处理学会)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出BenchTrace基准,通过反思评估和进化评估两个任务,结合失败避免率(FAR)指标,系统评估LLM智能体的自我进化能力,实验发现当前模型在反思诊断和泛化上存在显著瓶颈。
现在询问,以后使用:评估长期 LLM 代理中的主动性差距
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Noumena AI
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 针对长期 LLM 代理在跨会话中未能主动获取用户偏好而导致的主动性差距,提出 Ask-to-Remember (ATR) 基准 ATRBench,通过隐藏用户偏好作为真实值来量化该差距,并诊断出获取环节是瓶颈。
PipeMFL-240K:管道磁通量泄漏成像中目标检测的大规模数据集与基准
机构 * SINOMACH Sensing Technology \ ., Ltd Shenyang Liaoning China ; Institute of Science Tokyo Tokyo Japan ; Hokkaido University Sapporo Hokkaido Japan ; SINOMACH Sensing Technology \ ., Ltd ; Institute of Science Tokyo ; Hokkaido University
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 为解决管道磁通量泄漏检测中缺乏大规模公开数据集和基准的问题,构建了包含249,320张图像和200,020个边界框标注的PipeMFL-240K数据集,并评估了现有目标检测器,揭示了其在长尾分布、小目标和类内变异等挑战下的性能不足。
Comments Accepted by ACM KDD 2026 Datasets and Benchmarks Track
动态渐进式参数高效专家库混合用于终身机器人学习
机构 * The University of Hong Kong(香港大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) ; Huawei Cloud Computing Technologies(华为云计算技术) ; Ola Dimensions ; HKU Shanghai Intelligent Computing Research Center(香港大学上海智能计算研究中心)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 针对终身学习中任务标识不可用和知识隔离问题,提出动态渐进式参数高效专家库混合(DMPEL),通过构建低秩专家库和轻量路由器实现灵活的前向迁移,并引入专家系数回放缓解遗忘,在LIBERO基准上以最少可训练参数和存储超越现有方法。
Comments Accepted to Transactions on Machine Learning Research (TMLR) at https://openreview.net/forum?id=MHVBrjS8cG . Code is available at https://github.com/HarryLui98/DMPEL
大型语言模型是否具有社会适应性?对比大型语言模型与人类的信念演化
机构 * Tsinghua University(清华大学) ; Department of Psychological and Cognitive Sciences(心理与认知科学系) ; College AI(人工智能学院) ; School of Management(管理学院) ; Fudan University(复旦大学) ; Stevens Institute of Technology(史蒂文斯理工学院) ; Northwestern University(西北大学) ; University of Oxford(牛津大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本研究提出基于社会心理学的仿真基准FairMindSim和信念-奖励对齐行为演化模型BREM,通过连续经济游戏对比人类与LLM的决策动态,发现中等能力模型表现出过度惩罚的刚性攻击性,而前沿模型随推理能力提升趋向人类式的克制与宽容。
Comments KDD 2026 Oral