Does Multimodality Help Human and Machine for Translation and Image Captioning?
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
Comments 7 pages, 2 figures, v4: Small clarification in section 4 title and content
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
Comments 7 pages, 2 figures, v4: Small clarification in section 4 title and content
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments ECCV 2016
并非所有特征都具有同等价值:一种视觉-语言-动作模型的机制研究
机构 * Case Western Reserve University(凯斯西储大学)
专题命中 图文多模态 :multimodal(abstract,comments)
AI总结 研究通过激活注入、稀疏自编码器和线性探针分析视觉-语言-动作模型,发现视觉路径主导动作生成,语言敏感性取决于任务结构而非模型设计,且专家路径编码运动程序,VLM路径编码目标语义,释放Action Atlas供探索。
Comments Accepted to Multimodal Intelligence Workshop @ ICLR
专题命中 图文多模态 :分类 cs.CV、cs.CL、cs.AI;multimodal(comments)
Comments Proceedings of De-Factify 4: 4nd Workshop on Multimodal Fact Checking and Hate Speech Detection, co-located with AAAI-2025
$τ_0$-VLA:一种具有世界模型引导测试时计算能力的分层机器人基础模型
机构 * Shanghai Innovation Institute(上海创新研究院) ; Agibot Finch(智元 Finch(智元鹦鹉)) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 图文多模态 :multimodal(abstract)
AI总结 $τ_0$-VLA是一种分层机器人基础模型,通过世界模型引导的测试时计算分配额外资源优化子任务生成,经40115小时异构真实数据训练后,可提升长时程机器人操作的闭环成功率。
Comments 18 pages, 5 figures. Project page: https://tau0-vla.github.io/
用于组合概念泛化的多阶段训练量子模型
机构 * University College London(伦敦大学学院) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 图文多模态 :multimodal(abstract)
AI总结 该研究针对多模态学习的组合概念泛化挑战,提出带多阶段训练的量子模型,在CLEVR数据集上验证其可提升分布外关系泛化能力且参数远少于经典基准。
提炼学生可见内容:面向视觉语言模型的Fisher投影在线策略蒸馏
专题命中 图文多模态 :multimodal(abstract)
AI总结 针对视觉语言模型在线策略蒸馏中教师修正与学生能力不匹配的问题,提出FP-OPD方法,在8B到2B的蒸馏中使7个多模态基准平均得分分别提升2.77和1.60个点。
面向高效低比特大语言模型推理的异构感知微缩放技术
专题命中 图文多模态 :multimodal(abstract)
AI总结 研究针对低比特LLM推理的MX格式精度损失问题,提出异构感知的AdaMX格式与加速器,在不增加EBW的前提下提升精度、降低存储能耗,在多类LLM及多模态模型上表现优异。
GeoFlowVLM: 基于几何的联合不确定性用于冻结视觉-语言嵌入
机构 * Department of Information Technology, Uppsala University(乌普萨拉大学信息科技系) ; SciLifeLab, Uppsala University(乌普萨拉大学SciLifeLab)
专题命中 图文多模态 :cross-modal(abstract)
AI总结 GeoFlowVLM通过流匹配学习双编码VLM嵌入的联合分布,解决视觉-语言模型中缺乏联合不确定性的问题,提出条件检索熵和边际典型性得分以量化不确定性。
采用耳式光电容积描记法(PPG)与心电图(ECG)结合轻量混合学习框架的单搏无袖带血压估计
机构 * Vanderbilt University(范德堡大学) ; Vanderbilt Institute for Surgery and Engineering(范德堡外科工程研究所) ; Department of Electrical and Computer Engineering(电气与计算机工程系)
专题命中 图文多模态 :multi-modal(abstract)
AI总结 该研究提出轻量混合学习框架,结合ECG、耳式PPG与6轴IMU,实现单搏无袖带血压估计,在多阶段压力方案与PulseDB数据集上,较基线模型降低28.2%组合MAE,适配可穿戴部署。
Comments 7 pages, 5 figures
XS-VLA:将粗粒度空间蒸馏与潜在流匹配相结合用于轻量级机器人控制
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) ; Wuxi Dexteroushands Robotic Technology Co.(无锡灵犀机器人技术有限公司)
专题命中 图文多模态 :multimodal(abstract)
AI总结 提出XS-VLA框架,先通过微调从Qwen3-VL-4B向SmolVLM2-0.25B骨干网蒸馏空间语义知识,再用其增强骨干网训练潜在流匹配策略,提升轻量级机器人控制性能,在LIBERO基准测试中表现出色。
Comments Preprint
从诱饵中分离点击:使用大语言模型检测误导性的YouTube缩略图
专题命中 图文多模态 :multi-modal(abstract)
AI总结 研究针对YouTube等平台误导性缩略图问题,提出用大语言模型的多模态检测管道,构建数据集并评估多个模型,发现Claude 3.5 Sonnet性能突出,通过失败分析为视频平台发展提供方向。
Comments Accepted to the 21st International AAAI Conference on Web and Social Media (ICWSM 2027)
Journal ref Proceedings of the International AAAI Conference on Web and Social Media, 2027
CLIP:基于余弦定律的轻量级倒排列表剪枝技术用于IVF向量搜索
专题命中 图文多模态 :multimodal(abstract)
AI总结 针对IVF向量搜索中粗粒度执行导致高延迟的问题,提出基于余弦定律的轻量级剪枝技术CLIP,支持簇间和簇内剪枝,显著减少不必要的簇和向量访问,并开发了IVF-CLIP、HIVF-CLIP和LSM-IVF三种变体,实验表明剪枝率达78%,效率提升最高141%。
KALE:通过损失均衡实现网络规模下CLIP与DINOv2的稳定对齐的核对齐方法
专题命中 图文多模态 :image-text(abstract)
AI总结 研究在网络规模数据上CLIP与DINOv2对齐问题,引入KALE损失均衡控制器,自适应调整对齐权重,无需数据集微调,在CC12M子集实验中提升了模型图像-文本检索及线性探测性能,零样本性能显著提高。
Comments 13 pages, 7 figures, 6 tables
RhinoVLA 技术报告
机构 * Huixi Intelligence(慧溪智能)
专题命中 图文多模态 :multimodal(abstract)
AI总结 针对边缘硬件上VLA模型部署延迟问题,提出RhinoVLA,通过令牌高效骨干、连续动作专家和统一接口实现实时闭环控制,在Huixi R1上达到11.69 Hz推理速度。
Safe-Night VLA: 通过热感知视觉-语言-动作模型看见未见事物以实现安全关键操作
机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑机器人与机器智能研究所(MIRMI),技术大学慕尼黑(TUM))
专题命中 图文多模态 :multimodal(abstract)
AI总结 Safe-Night VLA通过整合热感知技术,实现了安全关键操作中的非可见领域感知与稳健执行。
Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
CLIP 潜在空间的超球面几何:一种语义混合模型
机构 * Tsinghua University(清华大学) ; Cisco Research(思科研究院) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 图文多模态 :multimodal(abstract)
AI总结 研究 CLIP 潜在空间,提出基于冯·米塞斯-费舍尔分布混合的密度模型,用期望最大化算法学习,实现准确可解释的密度估计,改善长尾和分布外检测,建立几何一致的概率框架。
Comments 23 pages, 8 figures
镜头中的恶魔:分析并防御可穿戴设备上针对视觉语言模型的物理提示注入
专题命中 图文多模态 :multimodal(abstract)
AI总结 研究针对可穿戴设备上视觉语言模型的物理提示注入攻击,利用真实环境照片分析出6种威胁向量及对12个模型的影响,攻击成功率高,还提出基于掩码的外部过滤器和基于语义向量的内部检测器两种防御策略。
强化学习会遗忘!迈向持续策略优化
机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education(教育部计算机网络和信息集成重点实验室(东南大学)) ; Zhongguancun Academy(中关村科学城公司) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)
专题命中 图文多模态 :multimodal(abstract)
AI总结 研究持续训练中强化学习易遗忘问题,引入MRCL基准测试,提出持续策略优化框架CPO,通过参数移动正则化减少遗忘,多模型规模实验验证了其有效性。
通过用密集CLIP泛化语义映射实现开放词汇目标导航
机构 * Shanghai AI Lab(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; Zhejiang University(浙江大学)
专题命中 图文多模态 :cross-modal(abstract)
AI总结 研究面向对象的实体导航任务,提出OVExp框架,利用密集CLIP模型展示基于语义地图的目标预测网络泛化能力,设计跨模态转移策略解决训练成本高问题,在ObjectNav基准上对未知目标有强大泛化能力。
Comments Accepted by ICRA 2026
UP:用于打破探索-稳定性困境的无界正不对称优化
机构 * ByteDance Seed(字节跳动种子) ; Michigan State University(密歇根州立大学)
专题命中 图文多模态 :multimodal(abstract)
AI总结 研究针对强化学习探索-稳定性困境,提出无界正不对称优化(UP)方法,通过特殊设计重组优化过程,在多种算法、模型架构及训练模式下增强探索能力,实现卓越推理精度,是通用即插即用的强化学习训练增强方法。
CAC-VLA:用于视觉-语言-动作模型的上下文门控动作条件调节
机构 * University of Science and Technology of China (USTC)(中国科学技术大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
专题命中 图文多模态 :multimodal(abstract)
AI总结 研究视觉-语言-动作模型,提出上下文门控动作条件调节框架CAC-VLA,在视觉语言模型中学习轻量级潜在动作接口,训练模型预测潜在动作并通过上下文门调节动作专家,实验验证其有效性。
Comments 16 pages, 6 figures
SEAM:用于视觉-语言-动作策略的动作块运动平滑执行
机构 * South China University of Technology(南方科技大学)
专题命中 图文多模态 :multimodal(abstract)
AI总结 研究视觉-语言-动作策略中动作块执行的多模态分叉问题,提出无训练推理时的SEAM方法,利用同步执行见解,通过速度引导损失转向机制减少边界抖动和块过渡不连续性。
Comments 8 pages, 4 figures, 5 tables
网络物理系统软件工程的基础模型:未来之路
专题命中 图文多模态 :multimodal(abstract)
AI总结 探讨基础模型在网络物理系统软件工程中的应用,指出除语言模型外其他模型潜力大。通过文献等得出前瞻性研究路线图,突出挑战与机会,还讨论了应用模型的常见挑战,为研究和实践提供指导。
Comments 3 figures, 20 tables, 53 pages
PhysReflect-VLA:面向可靠视觉-语言-动作策略的物理可行性与自反思调节
机构 * Xiamen University(厦门大学) ; Aberystwyth University(阿伯里斯特威斯大学)
专题命中 图文多模态 :multimodal(abstract)
AI总结 提出PhysReflect-VLA框架,通过物理可行性评估和结构化自反思增强VLA策略,在闭环控制中实现稳定多阶段操作,平均成功率提升5.4%。
PAMAE: 面向可靠流匹配视觉-语言-动作策略的相位感知MoE动作专家
机构 * Department of Artificial Intelligence, School of Informatics, Xiamen University(厦门大学信息学院人工智能系) ; Department of Computer Science, Aberystwyth University(阿伯里斯特威斯大学计算机科学系)
专题命中 图文多模态 :multimodal(abstract)
AI总结 针对多阶段机器人操作中VLA模型动作生成不可靠的问题,提出即插即用的相位感知混合专家动作模块PAMAE,通过稀疏专家混合和相位感知路由提升阶段一致性,在模拟任务中成功率提升9.2%。
WOLF-VLA:面向视觉-语言-动作学习的全身人形最优运动框架
机构 * Robotics Innovation Center, DFKI GmbH(德国人工智能研究中心机器人创新中心) ; University of Oldenburg(奥尔登堡大学) ; AG Robotik University of Bremen(不来梅大学机器人工作组)
专题命中 图文多模态 :multi-modal(abstract)
AI总结 提出WOLF-VLA框架,结合全身最优控制运动合成与大规模多模态数据集,训练VLA模型从自然语言指令生成人形运动策略,在多种任务中展现强鲁棒性和竞争力。
神经元能说话吗?单细胞分辨率的视觉语义叙述
专题命中 图文多模态 :multimodal(abstract)
AI总结 提出NEURRATOR框架,通过将神经元活动解码为自然语言描述,实现单细胞分辨率的视觉语义叙述,并用于量化解码保真度及解析单个神经元和特定细胞类型的功能贡献。
GIVE:在视觉-语言-动作模型中接地人类手势
机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)
专题命中 图文多模态 :multimodal(abstract)
AI总结 针对VLA模型忽略手势导致意图理解不准的问题,提出GIVE方法,通过视觉和语义双路径增强手势理解,在真实HRI实验中目标识别准确率提升40%,任务成功率提升80%。
Comments Project page: https://luis-cloud-sg.github.io/GIVE-project/
基于VLA的驾驶系统的安全案例模式:来自SimLingo的见解
机构 * York University(约克大学) ; National Institute of Informatics(国家信息研究所)
专题命中 图文多模态 :multimodal(abstract)
AI总结 针对VLA驾驶系统提出RAISE安全案例设计方法,通过扩展HARA和定制模式,结合SimLingo案例验证其构建基于证据的安全声明的有效性。