Learning-To-Measure: In-Context Active Feature Acquisition
学习测量:上下文主动特征获取
机构 * University of Tokyo(东京大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出 Learning-to-Measure (L2M) 方法,通过不确定性量化与条件互信息引导的贪婪特征获取,在上下文学习中解决元主动特征获取问题,无需针对每个任务重新训练。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
学习测量:上下文主动特征获取
机构 * University of Tokyo(东京大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出 Learning-to-Measure (L2M) 方法,通过不确定性量化与条件互信息引导的贪婪特征获取,在上下文学习中解决元主动特征获取问题,无需针对每个任务重新训练。
StreamingVLM:无限视频流的实时理解
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达)
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI、cs.CL
AI总结 提出StreamingVLM,通过统一训练与流推理的框架,利用注意力汇点状态复用和滑动窗口机制实现无限视频流的实时稳定理解,在Inf-Streams-Eval基准上以8 FPS速度达到66.18%胜率,并提升通用VQA能力。
Comments Published as a conference paper at ICLR 2026. The first two authors contributed equally to this work
追踪自适应智能体的行为轨迹
机构 * University of Birmingham(伯明翰大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出一种通过文本嵌入空间中的方向定义智能体特质的方法,训练线性模型对技能文件差异进行评分,实现高准确率的行为特质分类与排序。
Comments 5 pages, 1 figure. To appear at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026
评估算法选择模型的现实世界泛化能力
机构 * Computer Systems Department, Jožef Stefan Institute(计算机系统部门,约泽夫·斯蒂芬研究所) ; Brno University of Technology(布拉格技术大学)
专题命中 Agent评测 :planning(abstract);分类 cs.LG
AI总结 通过跨基准测试系统评估算法选择模型在合成与现实优化问题上的泛化能力,分析其迁移性能并指出在特定领域应用中的挑战。
Comments 10 pages, 12 figures
CRAB-Bench:在复杂任务依赖和人类对齐用户模拟下评估LLM智能体
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 提出CRAB-Bench和RUSE框架,通过约束图生成复杂任务依赖和基于人类行为研究的用户模拟,评估LLM智能体在真实服务场景中的表现,发现最佳模型仅达61%通过率,用户模拟导致性能下降高达57%。
JenBridge: 跨场景转换的自适应长视频配乐
机构 * Jen Music AI
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出JenBridge框架,通过基于Transformer的生成模型、双文本-视觉条件对齐和LLM代理驱动的自适应过渡机制,实现长视频配乐的高保真生成与场景转换自然连贯。
所有模型都是错的,知道哪里有用:强化学习中的模型不确定性
机构 * German Federal Ministry of Research, Technology and Space (BMFTR)(德国联邦研究、技术和空间部) ; Robotics Institute Germany (RIG)(德国机器人研究所) ; Institute for Data Science in Mechanical Engineering, RWTH Aachen University(机械工程数据科学研究所,亚琛工业大学) ; NHR Center NHR4CES at RWTH Aachen University(亚琛工业大学NHR4CES中心)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 提出通过针对性处理概率模型的不确定性来减轻模型利用的框架,并展示在硬件直接学习和安全探索方面的成功。
算法在绿色建筑节能设计平台中的应用
机构 * First Highway Engineering Co., Ltd.(第一公路工程有限公司)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出一种结合BIM、传感器数据和进化多目标优化的算法平台,通过动态能耗仿真降低建筑能耗29.3%,并验证了其可扩展性和技术可行性。
Comments 9 pages, 4 figures.2026 International Conference on Big Data Applications in Education and Engineering (ICBDAEE 2026)
机电系统参数辨识中最优实验设计的强化学习方法
机构 * Josef Ressel Centre for Intelligent and Secure Industrial Automation, Salzburg University of Applied Sciences, Salzburg, Austria(约瑟夫·雷斯尔智能与安全工业自动化中心,萨尔茨堡应用技术大学,萨尔茨堡,奥地利) ; Paris Lodron University of Salzburg, Salzburg, Austria(萨尔茨堡巴黎洛登伦大学,萨尔茨堡,奥地利)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 提出一种强化学习智能体,通过奖励塑形自主满足安全约束,为Quanser Aero 2测试平台学习最优激励信号,在三个辨识参数上均达到竞争性估计精度,且安全违规率仅0.75%。
Comments Accepted at DEXA AI4IP 2026
大型语言模型作为探索性数据分析代理的商业实用性
机构 * deepsense.ai ; SGH Warsaw School of Economics(SGH沃兹尼亚克经济学院) ; Bydgoszcz University of Science and Technology(比得戈茨茨理工大学) ; Google(谷歌)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 通过基于代理的供应链模拟基准,评估LLM作为EDA代理在商业环境中的平均性能与可重复性,提出风险调整指标Business utility,发现多数配置不可靠,GPT-5.4表现最佳。
全面的人工智能治理需要解决非模型增益问题
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; Open Philanthropy(开放哲学基金会)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出非模型增益的概念,包括推理增益、系统增益和资产增益,并论证这些增益会削弱以模型为中心的治理有效性,进而提出超越模型层面的治理方法。
Comments This paper has been accepted to ICML 2026 (Position paper track): https://openreview.net/forum?id=V3O1sHpKxX
Cookie-Bench: 面向网页生成的连续屏幕按键交互评估
机构 * Baidu Inc.(百度公司) ; Beijing, China(中国北京)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出一种无参考、自主驱动且整体推理的网页生成评估框架Cookie-Bench,通过元认知监控分阶段收集证据并评分,与专家评分高度一致。
OpenHospital: 一个用于进化和基准测试基于LLM的集体智能的物自体竞技场
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; Laboratory for Statistical Monitoring and Intelligent Governance of Common Prosperity, Zhejiang Gongshang University(浙江工商大学共同富裕统计监测与智能治理实验室) ; Tongyi Lab, Alibaba Group(阿里集团通义实验室) ; Alibaba Cloud(阿里云)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出OpenHospital交互式竞技场,通过医生代理与患者代理的互动进化集体智能,采用数据在代理自身范式快速提升能力并提供医学熟练度和系统效率的基准测试。
ADRA-Bank:面向学术深度研究智能体的模块化基准
机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) ; Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学) ; National University of Singapore, Singapore, Singapore(新加坡国立大学) ; Huawei Technologies, Hong Kong SAR, China(华为技术有限公司) ; Independent(独立)
专题命中 Agent评测 :planning(abstract);分类 cs.CL
AI总结 针对现有基准侧重检索而忽视规划与推理、且缺乏学术领域覆盖的问题,提出ADRA-Bank模块化基准,包含10个学术领域的200个人工标注实例,并设计ADRA-Eval评估范式,通过端到端和隔离评估两种模式测试规划、检索和推理能力,揭示智能体在跨源检索和跨领域一致性上的不足,并指出提升高层规划能力是释放基础LLM推理潜力的关键。
用LLM进行视频通话:对六个主流应用的测量活动
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 Agent评测 :AI agent(abstract);分类 cs.AI
AI总结 本文通过自定义测试平台和在线平台,从质量、延迟、内部机制和系统开销四个维度对六个主流AI视频聊天应用进行基准测试,发现AI视频通话的网络延迟影响小于人类视频通话,AI代理能力对用户体验影响最大。
优化嫉妒循环消除算法
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究通过启发式策略优化嫉妒循环消除算法,以在保持EF1公平性的同时提高社会福利。
无需反事实的决策者测试
专题命中 Agent评测 :agent(abstract)
AI总结 研究在bandit环境下,外部观察者如何仅基于观测到的决策、建议和臂实现来识别更知情的主体,并探讨了评分测试的存在性及其与福利最大化之间的权衡。
看向哪里:基础模型能否通过主动探索达到目标视角?
机构 * Zhejiang University(浙江大学)
专题命中 Agent评测 :agent(abstract)
AI总结 提出目标视角复现(TVR)任务及TVRBench基准,通过分析现有模型瓶颈并构建统一后训练框架,将9B开源模型成功率提升至50%以上。
Comments Project page: https://github.com/aim-uofa/TVRBench
重复下降:在线预算可行拍卖的框架
专题命中 Agent评测 :agent(abstract)
AI总结 提出基于自适应线性定价的确定性框架Repeated Descent,用于在线预算可行拍卖,在秘书到达和子模估值下实现1046-竞争比,并首次对非单调子模估值获得常数竞争比。
基于EuroCrops驱动的Sentinel-2作物分割的建模与评估框架
机构 * Transilvania University of Braşov(布拉索夫瓦拉米亚大学)
专题命中 Agent评测 :workflow(abstract)
AI总结 提出一个可配置的流水线,利用EuroCrops标注和Sentinel-2影像生成语义分割数据集,并训练U-Net模型评估其在域内和域外数据集上的性能。
邀请陷阱:通过对话诱导实现LLMs的主动可用性后门
专题命中 Agent评测 :agent(abstract)
AI总结 提出主动可用性后门(PAB)范式,利用LLMs的助人性通过主动社会工程诱导用户执行触发植入查询,实现高攻击性、精确性和隐蔽性。
Comments 29 pages
脑肿瘤手术中术中超声到MR合成的系统基准测试
机构 * Department of Neurosurgery, Neurovascular Unit Río Hortega University Hospital(里奥霍尔特ega大学医院神经外科部门,神经血管单元) ; Specialized Group in Biomedical Imaging and Computational Analysis (GEIBAC)(生物医学成像与计算分析专项组(GEIBAC)) ; Instituto de Investigación Biosanitaria de Valladolid (IBioVALL)(瓦尔拉多利德生物医学研究 institute(IBioVALL))
专题命中 Agent评测 :planning(abstract)
AI总结 针对脑肿瘤手术中术中超声(ioUS)到MR图像合成问题,本研究在公共ReMIND数据集上系统比较了6种生成器、4种推理模式和2种目标,结合图像保真度指标和下游分割评估,发现感知质量(LPIPS)与下游效用最相关,而SSIM与效用负相关,SynDiff-2.5D在下游分割中表现最佳。
SF-LIFE:旧金山湾区大规模模拟移动数据集
专题命中 Agent评测 :agent(abstract)
AI总结 为加速交通、移动性和机器学习研究,我们构建了SF-LIFE数据集,包含50万模拟智能体在旧金山湾区70天内以1Hz频率记录的完整、无噪声、多模态轨迹,并提供交通模式标签、降采样版本、活动信息、人口统计数据和OSM路网建筑数据。
反身性作为提示:对自我强化市场动态的认知是否提高了LLM作为金融市场预测者的表现?
专题命中 Agent评测 :agent(abstract)
AI总结 研究在繁荣-萧条市场周期中,逐步引入索罗斯反身性理论时,前沿大语言模型作为金融预测者的行为变化,通过方向性预测准确率和夏普比率评估,发现反身性认知在不同模型和上下文窗口中产生不同的预测改进。
InstructSAM: 根据任意指令分割任意实例
机构 * Zhejiang University(浙江大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
专题命中 Agent评测 :agentic(abstract)
AI总结 提出InstructSAM框架,通过将指令驱动实例分割建模为集合结构查询预测问题,并设计显式推理到实例查询接口,结合视觉语言模型和SAM3实现单次前向传播中的多实例分割。
Comments 19 pages, 8 figures, code: https://github.com/DCDmllm/InstructSAM
逆向选择下垄断保险市场的激励帕累托效率
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究隐藏信息下的垄断保险市场,证明满足激励相容和个体理性约束的社会福利最大化合同菜单是激励有效的,并在Yaari对偶效用下给出半显式刻画。
机制中的权力与自由
专题命中 Agent评测 :agent(abstract)
AI总结 本文在防策略机制中衡量代理人影响,将影响分为自由(对自身结果)和权力(对他人结果),并利用自由最大化刻画约束有效机制,应用于分配规则分析,得到顶级交易循环规则和双极序列独裁的新特征。
自动驾驶中的情境感知交互式MPC切换
机构 * Eindhoven University of Technology(埃因霍温理工大学) ; Delft University of Technology(代尔夫特理工大学)
专题命中 Agent评测 :agent(abstract)
AI总结 针对自动驾驶中交互场景的挑战,提出一种基于神经网络的分类器,根据情境需求在不同MPC控制器间切换,以平衡性能和计算开销。
拥塞博弈中激励机制对系统误设的鲁棒性
专题命中 Agent评测 :agent(abstract)
AI总结 研究系统参数误设对原子拥塞博弈中通行费设计的影响,证明轻微误设下设计的通行费不会引入新的纳什均衡,并给出了最坏情况下的性能下降上界。
Comments 6 pages, 3 figures
Iteris: 计算数学的智能体研究循环
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学北京国际数学研究中心和新基石科学实验室) ; Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) ; Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾研究院先进研究所智能计算中心) ; Zhongguancun Academy(中关村学院)
专题命中 其他Agent :agentic(title,abstract);分类 cs.AI、cs.LG
AI总结 提出Iteris智能体研究系统,通过数值实验、构造和证明草稿解决计算数学中的两个开放问题,经专家验证后获得可验证结果。
Comments 43 pages