Grounding Referring Expressions in Images by Variational Context
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments in 2018 Conference on Computer Vision and Pattern Recognition (CVPR'18)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments in 2018 Conference on Computer Vision and Pattern Recognition (CVPR'18)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
Comments 35 pages, 7 figures, magazine
Journal ref Neurocomputing 330: 17-28 (2019)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CL
Comments Accepted at NAACL 2019, Short Paper
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments German Conference on Pattern Recognition(GCPR)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Accepted in ACCV 2018
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments To appear in BMVC2018
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments 17 pages, 4 figures, Accepted at ECCV 2018
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments 4 pages, 3 figures
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
Comments 10 pages
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
Comments 7 pages, 2 figures, v4: Small clarification in section 4 title and content
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments ECCV 2016
并非所有特征都具有同等价值:一种视觉-语言-动作模型的机制研究
机构 * Case Western Reserve University(凯斯西储大学)
专题命中 图文多模态 :multimodal(abstract,comments)
AI总结 研究通过激活注入、稀疏自编码器和线性探针分析视觉-语言-动作模型,发现视觉路径主导动作生成,语言敏感性取决于任务结构而非模型设计,且专家路径编码运动程序,VLM路径编码目标语义,释放Action Atlas供探索。
Comments Accepted to Multimodal Intelligence Workshop @ ICLR
专题命中 图文多模态 :分类 cs.CV、cs.CL、cs.AI;multimodal(comments)
Comments Proceedings of De-Factify 4: 4nd Workshop on Multimodal Fact Checking and Hate Speech Detection, co-located with AAAI-2025
$τ_0$-VLA:一种具有世界模型引导测试时计算能力的分层机器人基础模型
机构 * Shanghai Innovation Institute(上海创新研究院) ; Agibot Finch(智元 Finch(智元鹦鹉)) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 图文多模态 :multimodal(abstract)
AI总结 $τ_0$-VLA是一种分层机器人基础模型,通过世界模型引导的测试时计算分配额外资源优化子任务生成,经40115小时异构真实数据训练后,可提升长时程机器人操作的闭环成功率。
Comments 18 pages, 5 figures. Project page: https://tau0-vla.github.io/
用于组合概念泛化的多阶段训练量子模型
机构 * University College London(伦敦大学学院) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 图文多模态 :multimodal(abstract)
AI总结 该研究针对多模态学习的组合概念泛化挑战,提出带多阶段训练的量子模型,在CLEVR数据集上验证其可提升分布外关系泛化能力且参数远少于经典基准。
提炼学生可见内容:面向视觉语言模型的Fisher投影在线策略蒸馏
专题命中 图文多模态 :multimodal(abstract)
AI总结 针对视觉语言模型在线策略蒸馏中教师修正与学生能力不匹配的问题,提出FP-OPD方法,在8B到2B的蒸馏中使7个多模态基准平均得分分别提升2.77和1.60个点。
面向高效低比特大语言模型推理的异构感知微缩放技术
专题命中 图文多模态 :multimodal(abstract)
AI总结 研究针对低比特LLM推理的MX格式精度损失问题,提出异构感知的AdaMX格式与加速器,在不增加EBW的前提下提升精度、降低存储能耗,在多类LLM及多模态模型上表现优异。
GeoFlowVLM: 基于几何的联合不确定性用于冻结视觉-语言嵌入
机构 * Department of Information Technology, Uppsala University(乌普萨拉大学信息科技系) ; SciLifeLab, Uppsala University(乌普萨拉大学SciLifeLab)
专题命中 图文多模态 :cross-modal(abstract)
AI总结 GeoFlowVLM通过流匹配学习双编码VLM嵌入的联合分布,解决视觉-语言模型中缺乏联合不确定性的问题,提出条件检索熵和边际典型性得分以量化不确定性。
采用耳式光电容积描记法(PPG)与心电图(ECG)结合轻量混合学习框架的单搏无袖带血压估计
机构 * Vanderbilt University(范德堡大学) ; Vanderbilt Institute for Surgery and Engineering(范德堡外科工程研究所) ; Department of Electrical and Computer Engineering(电气与计算机工程系)
专题命中 图文多模态 :multi-modal(abstract)
AI总结 该研究提出轻量混合学习框架,结合ECG、耳式PPG与6轴IMU,实现单搏无袖带血压估计,在多阶段压力方案与PulseDB数据集上,较基线模型降低28.2%组合MAE,适配可穿戴部署。
Comments 7 pages, 5 figures
XS-VLA:将粗粒度空间蒸馏与潜在流匹配相结合用于轻量级机器人控制
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) ; Wuxi Dexteroushands Robotic Technology Co.(无锡灵犀机器人技术有限公司)
专题命中 图文多模态 :multimodal(abstract)
AI总结 提出XS-VLA框架,先通过微调从Qwen3-VL-4B向SmolVLM2-0.25B骨干网蒸馏空间语义知识,再用其增强骨干网训练潜在流匹配策略,提升轻量级机器人控制性能,在LIBERO基准测试中表现出色。
Comments Preprint
从诱饵中分离点击:使用大语言模型检测误导性的YouTube缩略图
专题命中 图文多模态 :multi-modal(abstract)
AI总结 研究针对YouTube等平台误导性缩略图问题,提出用大语言模型的多模态检测管道,构建数据集并评估多个模型,发现Claude 3.5 Sonnet性能突出,通过失败分析为视频平台发展提供方向。
Comments Accepted to the 21st International AAAI Conference on Web and Social Media (ICWSM 2027)
Journal ref Proceedings of the International AAAI Conference on Web and Social Media, 2027
CLIP:基于余弦定律的轻量级倒排列表剪枝技术用于IVF向量搜索
专题命中 图文多模态 :multimodal(abstract)
AI总结 针对IVF向量搜索中粗粒度执行导致高延迟的问题,提出基于余弦定律的轻量级剪枝技术CLIP,支持簇间和簇内剪枝,显著减少不必要的簇和向量访问,并开发了IVF-CLIP、HIVF-CLIP和LSM-IVF三种变体,实验表明剪枝率达78%,效率提升最高141%。
KALE:通过损失均衡实现网络规模下CLIP与DINOv2的稳定对齐的核对齐方法
专题命中 图文多模态 :image-text(abstract)
AI总结 研究在网络规模数据上CLIP与DINOv2对齐问题,引入KALE损失均衡控制器,自适应调整对齐权重,无需数据集微调,在CC12M子集实验中提升了模型图像-文本检索及线性探测性能,零样本性能显著提高。
Comments 13 pages, 7 figures, 6 tables
RhinoVLA 技术报告
机构 * Huixi Intelligence(慧溪智能)
专题命中 图文多模态 :multimodal(abstract)
AI总结 针对边缘硬件上VLA模型部署延迟问题,提出RhinoVLA,通过令牌高效骨干、连续动作专家和统一接口实现实时闭环控制,在Huixi R1上达到11.69 Hz推理速度。