Conformal Coverage Guarantees for Any Video Temporal Grounder
任意视频时间定位器的共形覆盖保证
专题命中 效率与部署 :language model(abstract)
AI总结 针对视频时间定位器的模糊性问题,提出与模型无关的COVER包装器,可保证输出区域以至少1-α的概率包含真实时刻,在多基准和定位器上验证了其覆盖度符合目标值。
Comments Submitted to AAAI 2027
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
任意视频时间定位器的共形覆盖保证
专题命中 效率与部署 :language model(abstract)
AI总结 针对视频时间定位器的模糊性问题,提出与模型无关的COVER包装器,可保证输出区域以至少1-α的概率包含真实时刻,在多基准和定位器上验证了其覆盖度符合目标值。
Comments Submitted to AAAI 2027
先总结,后下载:面向带宽高效的地球观测的机载视觉语言模型
专题命中 效率与部署 :language model(abstract)
AI总结 针对地球观测卫星下行链路带宽瓶颈,提出“先总结,后下载”范式,通过机载VLM生成摘要、地面VQA验证后按需下载全分辨率图像,可降带宽消耗并加速时间敏感任务的洞察时间。
Comments IGARSS2026
PAST:用于高效扩散模型的提示自适应采样终止
机构 * Peking University(北京大学) ; Nanjing University(南京大学) ; Stanford University(斯坦福大学)
专题命中 效率与部署 :preference optimization(abstract)
AI总结 PAST是一种提示自适应采样终止方法,通过双自适应协调机制提升扩散模型RL微调的计算效率与偏好优化质量,效率最高提升66.7%,质量最高提升29.5%。
用于细粒度视频表情识别的基于能量缓存的在线个性化测试时自适应
专题命中 效率与部署 :language model(abstract)
AI总结 针对视频FER的测试时自适应难题,提出EB-CaP方法,通过轻量级能量模型结合CLIP生成个性化缓存,在低开销下优于现有SOTA方法。
下一张截图知晓:面向移动GUI智能体的门控事后蒸馏(Gated Hindsight Distillation)
专题命中 效率与部署 :language model(abstract)
AI总结 本文针对移动GUI智能体训练中丢失动作依据的问题,提出门控事后蒸馏方法,利用下一张截图作为特权信息,在AndroidWorld等基准上相比GRPO提升了任务成功率。
BridgeVLA++:一种面向三维操作的数据高效、可泛化且内存增强的视觉-语言-动作框架
机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR)) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; FiveAges ; ByteDance Seed(字节跳动种子实验室)
专题命中 效率与部署 :language model(abstract)
AI总结 本研究提出内存增强的三维VLA框架BridgeVLA++,通过新增时空记忆架构,在保留原模型数据效率与泛化能力的同时,提升了记忆相关操作性能,且在多任务与真实平台上验证了其有效性。
Comments This work has been submitted to the IEEE TPAMI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
SurgNarrator:面向手术视频理解的生成式检索框架
机构 * University of Liverpool(利物浦大学) ; City University of Hong Kong(香港城市大学) ; University of Oxford(牛津大学) ; University of Strasbourg(斯特拉斯堡大学) ; IHU Strasbourg(斯特拉斯堡大学医院研究所) ; Imperial College London(帝国理工学院)
专题命中 效率与部署 :language model(abstract)
AI总结 SurgNarrator是专为手术视频理解设计的生成式检索框架,通过构建手术词汇表、适配Qwen3-VL-Embedding-8B并采用分层检索策略,在零样本设置下于12个基准上实现性能提升且延迟大幅降低。
Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
并非所有冗余视觉标记都相同:通过标记角色分析视觉标记剪枝
机构 * Maum AI Inc.(Maum AI公司)
专题命中 效率与部署 :language model(abstract)
AI总结 本研究针对视觉-语言模型(VLMs)的视觉标记剪枝问题,通过EmbedLens分析标记角色,发现代表性剪枝方法存在标记角色偏差但与下游性能无直接关联,优化角色分配后表明保留非活跃标记可维持或提升性能,为剪枝方法优化提供了新视角。
Comments Accepted to ECCV 2026 workshop, UniWorld
MuRA:用于高效且有效的测试时视觉-语言泛化的多秩适配
专题命中 效率与部署 :language model(abstract)
AI总结 针对测试时视觉-语言模型因静态秩配置导致的性能瓶颈,提出多秩适配(MuRA)框架,动态选择适配模块,在多基准测试中达最优准确率且降低计算内存开销。
LiteMVS:结合基础模型蒸馏与专家聚合的高效多视图立体匹配
专题命中 效率与部署 :foundation model(abstract)
AI总结 LiteMVS是集成平面扫描几何推理与单目先验的轻量多视图深度模型,通过MoE和基础模型蒸馏提升重建质量与效率,在ScanNetv2等数据集上表现优异。
Comments CVPR 2026 Workshop accepted
面向三值大语言模型的带符号数位键值缓存的统一查表推理
专题命中 效率与部署 :post-training(abstract)
AI总结 针对三值大语言模型注意力机制中K/V缓存与权重投影的精度不匹配问题,提出带符号数位K/V缓存的统一查表推理方法,经实验验证可提升缓存、质量与硬件效率。
SABRE:预算约束下选择分布外检测器的多智能体方法
专题命中 效率与部署 :language model(abstract)
AI总结 SABRE是一种多智能体方法,可在预算约束下针对视觉-语言模型的分布外检测,自动选择各领域最优检测器,解决固定检测器跨领域失效的问题,实现可靠检测。
LowRank-SSM:面向FPGA上秩约简Mamba加速的软硬件协同设计
专题命中 效率与部署 :post-training(abstract)
AI总结 LowRank-SSM是面向FPGA的软硬件协同设计框架,通过软件的秩约简与硬件的双路径投影等设计,在保证精度的同时,使Mamba类SSM的FPGA部署吞吐量提升2.19倍、能效提升2.03倍。
更好、更强、更快、更广泛:基于多模态大型语言模型(MLLM)的结构化全掩码预测分割
机构 * The Hong Kong University of Science and Technology (HKUST)(香港科技大学)
专题命中 效率与部署 :language model(abstract)
AI总结 STAMPlus通过结构化全掩码预测解耦自回归对话与非自回归掩码预测,解决了MLLM分割的三难问题,在提升性能的同时降低延迟,实现多类开放词汇等分割任务的SOTA表现。
等变变换器的优点与缺点
专题命中 效率与部署 :foundation model(abstract)
AI总结 研究洛伦兹等变变换器在大尺寸喷注与味道标记中的表现,优化其推理成本后发现,几何特征相关时其性能优于标准变换器,可为LHC数据基础模型开发提供参考。
Comments 32 pages, 18 figures, 6 tables
用于学习型图像编码的哈达玛域模型量化
专题命中 效率与部署 :post-training(abstract)
AI总结 针对学习型图像编码均匀INT8量化性能受限问题,提出HaTQ方法,通过哈达玛重参数化适配INT8量化,实验显示其在不同设置下性能提升且推理效率高。
DF³:自主导航中基于无解码器特征预测的世界建模
机构 * The University of Manchester(曼彻斯特大学) ; University of Technology Sydney(悉尼科技大学) ; Shandong University(山东大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与部署 :foundation model(abstract)
AI总结 本研究提出DF³框架,通过冻结视觉基础模型、MACF机制及专用任务查询,在潜在空间直接预测特征并生成任务输出,在性能与效率上实现平衡,适用于自主导航的世界建模。
消息而非令牌:用于忠实VLM压缩的基础核心集
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Wuhan AI Research(武汉人工智能研究院) ; Cardiff University(卡迪夫大学)
专题命中 效率与部署 :language model(abstract)
AI总结 该研究针对VLM视觉令牌压缩的现有缺陷,提出无需训练的GMC方法,通过联合分配多维度证据支持并传输被丢弃状态,在大幅减少视觉令牌的同时保持VLM性能,经多基准实验验证有效。
Comments 32 pages, 6 figures, 18 tables, including appendix
相同语义,不同路径:面向视觉-文本压缩的自改进对齐
机构 * Southeast University(东南大学) ; Nanjing University(南京大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
专题命中 效率与部署 :preference optimization(abstract)
AI总结 该研究针对视觉-文本压缩中渲染图像与原生文本表示的跨路径不一致瓶颈,提出自监督对齐框架SPIRAL,通过令牌级OPD与序列级DPO提升模型性能,在VTCBench上显著改善Qwen3-VL-8B的表现并实现域外泛化。
Comments Accepted to ACM Multimedia 2026 (Oral)
UniSim-SLAM:采用统一Sim(3)优化的前馈SLAM
机构 * National Institute of Science and Technology(国立科学技术研究所)
专题命中 效率与部署 :foundation model(abstract)
AI总结 UniSim-SLAM是采用统一Sim(3)优化的前馈SLAM系统,通过前端两视图跟踪与后端多视图子图优化,在TUM RGB-D和7-Scenes数据集上实现了当前最佳未校准设置下的轨迹精度,误差显著降低。
Comments Accepted at ECCV 2026. Project page: https://vision3d-lab.github.io/unisim-slam/
Spike-HTR:用于手写文本识别的脉冲神经Transformer
专题命中 效率与部署 :language model(abstract)
AI总结 针对手写文本识别的计算不平衡问题,提出混合脉冲识别器Spike-HTR,通过InkCoder和CTC引导的长度缩减器优化,在多个数据集上取得低字符错误率。
集式推理的流式视频令牌压缩
专题命中 效率与部署 :LLM(abstract)
AI总结 该研究针对流式视频令牌压缩的参考集困境,提出无训练的NovaCov集式压缩器,在保留ReKV 99.6%准确率的同时降低46%的大语言模型预填充延迟,性能优于现有无训练方法。
Comments 9 pages, 3 figures, 4 tables
反转隐藏内容:揭示协作式大型视觉语言模型(LVLM)推理中的多模态隐私泄露
专题命中 效率与部署 :language model(abstract)
AI总结 该研究针对协作式LVLM推理的隐私风险,提出RASR多模态重建攻击,可从深层LVLM隐藏状态恢复隐私信息,图像重建MSE降约50%、文本恢复token准确率达99%。
模型作为工具:用于统一多模态视觉跟踪的智能体协调框架
机构 * Beihang University(北京航空航天大学)
专题命中 效率与部署 :foundation model(abstract)
AI总结 针对现有视觉跟踪方法的瓶颈,提出ACTrack智能体协调框架,整合异构模型工具的互补优势,仅用30%可训练参数便在多类基准上实现性能超越。
Comments 21 pages, 15 Tables, 7 Figures
用于批量机器人策略服务的动作块调度
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 效率与部署 :foundation model(abstract)
AI总结 本文提出从远程GPU向多机器人提供策略服务的调度问题,构建Armory系统,提出考虑机器人异构性的调度算法,使真实场景系统吞吐量最高提升18%。
手术增强现实中的实时视觉遮挡检测
机构 * Duke University(杜克大学)
专题命中 效率与部署 :language model(abstract)
AI总结 针对手术AR虚拟内容遮挡手术器械的问题,提出结合VLM与分割推理的延迟感知流水线,构建伪AR基准,实现87.43%准确率、479 ms延迟,较云端基线降延迟62.90%。
Comments ISMAR 2026 Mecidal Workshop
结果引导蒸馏:一种提升自动驾驶中视觉语言模型推理能力的师生框架
机构 * Stony Brook University(石溪大学) ; Rutgers University(罗格斯大学) ; Sunrise Technology Inc.(晨昇科技公司)
专题命中 效率与部署 :language model(abstract)
AI总结 本研究提出结果引导蒸馏的师生框架,将VLM的显式推理与几何轨迹生成结合,在Waymo基准上使自动驾驶性能提升约24%,优于经典推理基线。
推理前校准:针对视觉语言模型中语义漂移的鲁棒视觉令牌缩减
专题命中 效率与部署 :language model(abstract)
AI总结 该研究针对VLMs的语义漂移问题,提出无训练的CaRe框架,通过两个互补模块校准视觉表示,在剪枝94.4%视觉令牌时保留96.4%原性能,使推理速度提升最高2.30倍。
MeshFM:3D形状理解仅需2D特征
机构 * University of Chicago(芝加哥大学)
专题命中 效率与部署 :foundation model(abstract)
AI总结 该研究提出MeshFM框架,将2D视觉基础模型的特征提炼到3D,无需3D标注和推理优化,其2D监督训练的特征可直接用于多项3D下游任务,性能媲美3D监督方法且对极端旋转鲁棒。
Comments Project page: https://threedle.github.io/MeshFM/
Ripple:基于跨模态循环记忆的实时流音频-视频生成
机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司)
专题命中 效率与部署 :post-training(abstract)
AI总结 本文提出Ripple系统,通过跨模态循环记忆机制及三阶段训练方案,实现480P下约28 FPS的实时流音频-视频生成,性能优于现有方法。