Agent Delivery Engineering Predictive Reliability Framework
智能体交付工程预测可靠性框架
专题命中 评测与基准 :LLM(abstract)
AI总结 针对长期语言模型多智能体系统的可靠性风险,提出ADE预测可靠性框架,聚合异构信号为信任边际指标,用三重方法并行预测,经多轮验证和实验,能检测“虚假繁荣”,实现可靠性量化并提供前瞻性警告。
Comments 117pages,83figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
智能体交付工程预测可靠性框架
专题命中 评测与基准 :LLM(abstract)
AI总结 针对长期语言模型多智能体系统的可靠性风险,提出ADE预测可靠性框架,聚合异构信号为信任边际指标,用三重方法并行预测,经多轮验证和实验,能检测“虚假繁荣”,实现可靠性量化并提供前瞻性警告。
Comments 117pages,83figures
看清关键所在:用于胸部X光报告生成的病灶感知高分辨率补丁发现与融合
机构 * The University of Sydney(悉尼大学) ; The University of Newcastle(纽卡斯尔大学) ; University of Wollongong(卧龙岗大学) ; The University of Adelaide(阿德莱德大学)
专题命中 评测与基准 :foundation model(abstract)
AI总结 研究针对胸部X光报告生成中高分辨率感知难题,提出LePaX框架。该框架将高分辨率感知设为固定令牌预算下的空间分辨率分配问题,通过可学习空间分辨率分配和全局-区域融合两个组件,在不增令牌数时实现高分辨率CXR感知,提升了临床和语言指标。
WildCity:用于渲染、模拟和空间智能的真实世界城市规模测试平台
机构 * May Mobility(五月出行公司) ; New York University(纽约大学) ; NVIDIA(英伟达公司) ; Stanford University(斯坦福大学)
专题命中 评测与基准 :foundation model(abstract)
AI总结 针对人工智能在构建城市规模空间表征方面的挑战,引入WildCity真实世界多模态数据集,建立重建基线并转化为模拟器,分析关键挑战,推动城市规模渲染及相关人工智能发展。
Comments ECCV 2026; Project Page: https://han-xiangyu.github.io/Wild-City/
MonoIR-RS:基于CLIP和VLM适配的红外遥感视觉语言学习
机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) ; Guizhou University(贵州大学) ; Shenzhen Research Institute of Big Data(深圳大数据研究院) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 评测与基准 :instruction tuning(abstract)
AI总结 研究针对红外视觉语言理解未充分探索的问题,提出MonoIR-RS数据集及基准,结合多种方法构建并微调模型,提升红外遥感视觉语言学习性能,为红外与语言对齐提供可控测试平台。
一种用于综合交通标志状况评估的VLM增强框架,集成白天视觉性能和夜间逆反射率评估
机构 * Department of Civil and Environmental Engineering University of Missouri- Columbia(土木与环境工程系密苏里大学哥伦比亚分校)
专题命中 评测与基准 :language model(abstract)
AI总结 研究开发用于综合评估交通标志状况的新框架,利用微调视觉语言模型评估白天视觉性能,结合激光雷达校准的逆反射率评估夜间性能,集成到标志状况指数,提供经济有效的评估方法,LLaVA和Qwen表现优,还标记出需更换的标志。
Comments 21 pages, 7 figures, 5 tables. Preprint. An earlier version of this work was presented at the 105th Annual Meeting of the Transportation Research Board (TRB), January 2026
Andha-Dhun:对印地语音频描述的初步研究
机构 * CVIT, IIIT Hyderabad(海得拉巴国际信息技术研究所计算机视觉与信息处理中心) ; Manipal University Jaipur(斋浦尔曼ipal大学) ; Jio Platforms Ltd.(Jio平台有限公司)
专题命中 评测与基准 :LLM(abstract)
AI总结 该研究针对印度尚无印地语音频描述工作的现状,引入Andha-Dhun数据集,探索直接从英语描述生成及翻译英语ADs两种方法来生成印地语ADs,并进行评估,发现简单翻译和机器翻译存在问题,强调要为印度BLV观众调整内容。
Comments Accepted to NCVPRIPG 2026, Download data at https://github.com/katha-ai/AndhaDhun-HindiAD
WebRetriever:用于高效网络智能体评估的大规模综合基准测试
机构 * Mininglamp Technology(旷视科技) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所综合技术集成中心)
专题命中 评测与基准 :LLM(abstract)
AI总结 针对现有网络智能体评估基准测试的局限,提出WebRetriever这一大规模综合基准测试,涵盖多领域网站和任务。采用NavEval框架及三个评估协议,实验揭示不同协议性能差异,为网络智能体研发提供细粒度见解和严谨基础。
从车道感知角度评估自动驾驶对环境错觉的鲁棒性:基准测试
机构 * SKLCCSE, the School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院软件安全技术与工程北京市重点实验室) ; the School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络空间科学与技术学院) ; Henan University of Science and Technology(河南科技大学) ; the School of Computing, National University of Singapore(新加坡国立大学计算学院) ; College of Computing & Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 评测与基准 :language model(abstract)
AI总结 研究自动驾驶对环境错觉的鲁棒性,聚焦传统车道检测和视觉语言模型系统。引入基准LanEvil++并评估,发现错觉严重影响性能,阴影干扰最大。提出多模态错觉防御方法MIDA,有效提升了模型在挑战性条件下的鲁棒性。
Comments Accepted by IEEE TPAMI 2026
PiSAs:多用户智能体系统中情境完整性的基准测试
专题命中 评测与基准 :LLM(abstract)
AI总结 研究多用户智能体系统新隐私风险,引入PiSAs基准,用双重情境完整性注释评估无意泄露,可跨组件和接口测量跨用户数据泄露,发现模型判断影响结果,强调隐私保护策略需求。
用于过度自信的热视觉场所识别的轨迹锚点优化:零泄漏异常检测与绑架机器人恢复
专题命中 评测与基准 :foundation model(abstract)
AI总结 研究针对基于基础模型的热视觉场所识别前端在分布外或未映射条件下的过度自信强制匹配失败问题,提出轨迹锚点优化(TAO),通过压缩多视图时间验证解决组合挑战,实现高效故障安全过滤。
Comments 11 pages, 5 figures, technical report
无人机的最后一米精确导航:一种扩散细化的空中视觉伺服方法
机构 * FST and ICI, University of Macau(澳门大学科技学院及资讯与通信技术研究所)
专题命中 评测与基准 :foundation model(abstract)
AI总结 研究无人机最后一米精确导航,提出DreamNav框架,先粗估计旋转,再用预训练世界模型模拟未来视觉观测选轨迹,贡献PairUAV基准测试,实验表明DreamNav性能优。
ThermoForce:用于构建暖通空调控制的物理结构干预世界模型
专题命中 评测与基准 :foundation model(abstract)
AI总结 研究建筑暖通空调系统模型预测控制所需的热模型问题。提出ThermoForce,将时间序列基础模型冻结为被动自由响应,学习物理结构的强制响应算子,在相关干预中表现出色,嵌入MPC可降低热不适与能耗。
Comments 23 pages, 9 figures
WSA$_1$:用于可泛化机器人控制的以3D为中心的世界-空间-动作模型
机构 * Tongji University(同济大学) ; Shanghai Innovation Institution(上海创新机构) ; Shanghai Magic(上海魔星) ; Koala Uran Project(考拉铀项目)
专题命中 评测与基准 :foundation model(abstract)
AI总结 研究针对当前机器人基础模型缺乏物理动力学推理等问题,提出以3D为中心的世界-空间-动作建模范式构建WSA$_1$模型,能学习3D世界感知视觉思维并建模约束,提升泛化能力且数据高效。
IDEAL-Bench:用于分析3D布局推理的室内数据集和评估套件
机构 * Department of Computer Science Dartmouth College(达特茅斯学院计算机科学系)
专题命中 评测与基准 :language model(abstract)
AI总结 介绍IDEAL-Bench评估套件,让视觉语言模型预测室内场景结构化3D布局,基于IDEAL-Scenes数据集,评估15个模型发现任务待解、模型存在不对称性及排名差异,为下一代模型空间智能评估铺路。
Comments 36 pages. Project page: https://ideal3d.github.io/
自然语言相机运动理解
机构 * Boston University(波士顿大学) ; Pixocial Technology(皮克索西尔科技公司)
专题命中 评测与基准 :language model(abstract)
AI总结 研究自然语言相机运动理解问题,指出现有视觉语言模型在此任务上的不足。核心方法是建立分类法、基准和训练集。主要贡献是微调的VLM - 8B在基准测试中性能优于Gemini 3.1 Pro。
Comments Accepted to ECCV 2026
一种评估大语言模型道德敏感性的可扩展方法
专题命中 评测与基准 :LLM(abstract)
AI总结 研究如何评估大语言模型道德敏感性,提出新方法解决AI对齐研究中行为评估的问题,引入MORPH-1K基准测试并应用于八个模型,证明相关特征语义内容稳定。
Comments 9 pages, 3 figures, preprint
ChainSWE:在多漏洞软件维护中对编码代理进行基准测试
专题命中 评测与基准 :language model(abstract)
AI总结 研究针对语言模型代理在多漏洞软件维护中的评估问题,引入ChainSWE基准,通过收集Python项目问题链进行评估,发现链长度增加时性能下降。
对基准进行基准测试:工具调用评估的有效性审计
专题命中 评测与基准 :LLM(abstract)
AI总结 对四个主要工具调用基准家族进行系统有效性和可重复性审计,发现诸多评估者与人类意见分歧,指出当前分数可能反映评估者问题而非智能体能力,还介绍相关分类、审计工件等及新基准和系统。
LongEgoRefer: 长形式自我中心视频指代表达理解基准
机构 * Woven by Toyota, Japan(丰田公司,日本) ; The University of Tokyo, Japan(东京大学,日本) ; National Institute of Informatics, Japan(日本信息机构国家研究所) ; Institute of Science Tokyo, Japan(东京科学研究所,日本) ; NII LLMC, Japan(日本信息机构LLMC) ; Kyoto University, Japan(京都大学,日本)
专题命中 评测与基准 :language model(abstract)
AI总结 提出LongEgoRefer基准,基于Ego4D长视频构建,解决现有基准仅关注短视频导致目标稀疏和活动复杂的问题,评估现有方法发现性能显著下降,凸显长形式自我中心时空定位的挑战。
Comments ECCV 2026. Dataset and code: https://github.com/shunya-kato/LongEgoRefer
FoundDP:重新审视双像素深度估计中的弱视差可观测性
机构 * Huazhong University of Science and Technology(华中科技大学)
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出FoundDP框架,结合双像素深度与单目深度基础模型的全局结构先验,通过ViT特征对齐缓解散焦模糊导致的表示退化,在弱视差区域提升结构一致性与度量精度。
RTE-FM-Dehazer: 辐射传输方程启发的流匹配用于真实图像去雾
机构 * Mashang Consumer Finance Co. Ltd(马上消费金融股份有限公司) ; Tsinghua University(清华大学) ; Hunan University(湖南大学) ; University of Liverpool(利物浦大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 评测与基准 :language model(abstract)
AI总结 提出基于辐射传输方程(RTE)的流匹配去雾方法RTE-FM-Dehazer,通过扩散-吸收正则化引导去雾轨迹,并构建包含5万对真实雾/清晰图像的P-HAZE数据集,在五个真实基准上取得领先结果。
硅像素探测器研发的基于证据的检索基准与混合RAG框架
专题命中 评测与基准 :language model(abstract)
AI总结 针对硅像素探测器文献检索瓶颈,提出首个基于证据的检索基准和混合检索框架,结合稀疏、密集、混合检索和图探索,实验表明混合稀疏-密集检索在证据恢复上最可靠。
Comments 30 pages, 12 figures
GKDT: 通用关键点检测Transformer
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Australian National University(澳大利亚国立大学) ; Tencent Inc.(腾讯公司) ; Adelaide University(阿德莱德大学)
专题命中 评测与基准 :language model(abstract)
AI总结 提出通用关键点检测模型GKDT,基于大规模统一数据集MegaKPT和DINOv3 Transformer,支持视觉/文本提示,在22个测试集上多数类别PCK@0.1超90%。
Comments Accepted by ECCV 2026
文本到图像模型是归纳主义的火鸡吗?一个用于因果推理的反事实基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 评测与基准 :language model(abstract)
AI总结 提出反事实基准CF-World,通过三个递进层级测试T2I模型在违反现实先验规则下的图像生成能力,发现所有模型在反事实设置下性能急剧下降,原因是模型将世界知识与视觉外观编码为紧密耦合的模式。
Comments 10 pages, 7 figures. Project page: https://github.com/jylei16/CF-World.github.io
基于地标的心脏分割的自监督时间正则化与自动AHA区域映射
机构 * Biomedical Image Technologies, ETSI Telecomunicación, Universidad Politécnica de Madrid, Madrid, Spain(生物医学图像技术,电信工程学院,马德里理工大学,马德里,西班牙) ; Centro de Investigación Biomédica en Red de Bioingeniería, Biomateriales y Nanomedicina (CIBER-BBN), Instituto de Salud Carlos III, Madrid, Spain(生物工程、生物材料和纳米医学网络生物医学研究中心(CIBER-BBN),卡洛斯三世健康研究所,马德里,西班牙) ; APOLO Biotech, Ciudad Autónoma de Buenos Aires, Argentina(APOLO Biotech,布宜诺斯艾利斯自治市,阿根廷) ; Departamento de Computación, Universidad de Buenos Aires, Ciudad Autónoma de Buenos Aires, Argentina(计算系,布宜诺斯艾利斯大学,布宜诺斯艾利斯自治市,阿根廷) ; Instituto de Ciencias de la Computación (ICC), CONICET-Universidad de Buenos Aires, Ciudad Autónoma de Buenos Aires, Argentina(计算机科学研究所(ICC),CONICET-布宜诺斯艾利斯大学,布宜诺斯艾利斯自治市,阿根廷)
专题命中 评测与基准 :post-training(abstract)
AI总结 提出自监督时间正则化方法,利用图像序列的时间一致性增强心脏分割和运动估计的连续性,并自动映射到AHA 17节段标准,在CAMUS数据集上验证了临床实用性。
Comments Accepted at MICCAI 2026
DrivingDepth: 稀疏提示的像素级尺度校正用于驾驶深度估计
机构 * Baidu Inc.(百度公司)
专题命中 评测与基准 :foundation model(abstract)
AI总结 针对自动驾驶深度估计中几何与尺度的冲突,提出DrivingDepth方法,利用稀疏LiDAR作为几何提示,通过残差像素级尺度校正校准冻结的深度基础模型,在保持密集视觉几何的同时实现度量精度与几何一致性。
一视频一世界:将单目视频转化为物理4D场景
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; SparcAI Inc(SparcAI公司) ; University of Science and Technology of China(中国科学技术大学) ; The Hong Kong Polytechnic University(香港理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Nanyang Technological University(南洋理工大学) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
专题命中 评测与基准 :language model(abstract)
AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。
Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/
重新审视视觉-语言-动作模型中的参数冗余:从VLM到VLA适配的见解
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)
专题命中 评测与基准 :language model(abstract)
AI总结 通过分析VLM到VLA适配中参数差异的空间分布,设计多模块联合剪枝方案,在无需微调恢复的情况下减少12%-30%参数并保持约90%性能。
Comments 22 pages, 3 figures, ECCV 2026 Conference
重新思考特征工程与学习策略在少样本隐藏情感识别中的作用
机构 * Hefei University of Technology(合肥工业大学) ; University College London(伦敦大学学院) ; The University of Sydney(悉尼大学) ; Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯光科技有限公司) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) ; Beihang University(北京航空航天大学) ; The University of New South Wales(新南威尔士大学) ; United Arab Emirates University(阿拉伯联合酋长国大学)
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出跨注意力机制与多实例学习框架,利用多源特征(2D/3D骨架、面部Blendshapes、DINOv2/v3、X-CLIP、Gemini)解决长视频中弱稀疏隐式情感识别,在IJCAI挑战赛Track 3中获第一名。
一种增强的无源无监督域适应框架:基于预测编码和测试时训练的跨数据集脑电情感识别
专题命中 评测与基准 :pretraining(abstract)
AI总结 提出一种无源无监督域适应框架,通过非对比预测编码自监督预训练和双阶段自适应优化(多损失自适应正则化与局部一致性学习),结合轻量测试时训练,解决跨数据集脑电情感识别中的域偏移和噪声伪标签问题。
Comments Under review