An AI4AI Framework for Visual Token Pruning
用于视觉令牌剪枝的AI4AI框架
专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 本研究提出AutoPrune框架,通过TPDSL让LLM自动设计视觉令牌剪枝策略,在14个多模态基准和3个MLLM主干上,剪枝94.4%视觉令牌仍保留超99%性能,大幅降低推理成本。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
用于视觉令牌剪枝的AI4AI框架
专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 本研究提出AutoPrune框架,通过TPDSL让LLM自动设计视觉令牌剪枝策略,在14个多模态基准和3个MLLM主干上,剪枝94.4%视觉令牌仍保留超99%性能,大幅降低推理成本。
全模态分解自编码器学习全栈可穿戴解耦表示
机构 * Khalifa University(哈利法大学) ; University of Toronto(多伦多大学) ; MIT Media Lab(麻省理工学院媒体实验室) ; Aristotle University of Thessaloniki(亚里士多德大学)
专题命中 多模态训练与对齐 :omni-modal(title,abstract);multi-modal(abstract);分类 cs.AI、eess.AS
AI总结 该研究针对现有多模态可穿戴模型的不足,提出OmniDecVAEs框架,在30模态的HAR任务中,提升了识别准确率与数据合成质量,可用于边缘可穿戴与医疗领域。
Comments 15 pages, 7 figures, 7 tables
通过条件解码实现鲁棒的多模态安全性
机构 * The Ohio State University(俄亥俄州立大学) ; AWS(亚马逊云服务)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出CASA方法,通过内部表示预测安全令牌以提升多模态大语言模型的安全性,实验显示其在多种基准上显著降低攻击成功率,同时保持良性输入的实用性。
Comments 9 pages + Appendix section
多模态大模型模态迁移:自主地理信息系统智能体的先决条件
机构 * Graz University of Technology(格拉茨工业大学) ; University of Vienna(维也纳大学) ; University of Liverpool(利物浦大学)
专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);multi-modal(abstract);分类 cs.AI
AI总结 本文针对自主GIS智能体的先决条件,提出LMM模态迁移任务,发现现有LMM在图像与文本模态间传递空间信息的能力不足,需加强多模态对齐以实现地理空间理解。
学习在多模态大语言模型(MLLMs)中预测中间层注意力以进行视觉token剪枝
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对MLLMs视觉token剪枝的固定层非最优及计算成本高的问题,提出MAP方法,实现仅保留5.56%视觉token时维持97.5%性能,获3.09倍端到端加速。
自预训练(SPT)真的有助于改进医疗时间序列的诊断吗?
机构 * Università Campus Bio-Medico di Roma(罗马生物医学大学校园大学) ; Umeå University(于默奥大学) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ELLIS Institute Tübingen(埃利斯研究所蒂宾根分所)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 该研究探究自预训练(SPT)对Transformer在医疗时间序列诊断任务的影响,发现SPT可提升分类准确率0-6个百分点,是无需修改架构的通用有效策略。
Comments 21 pages, 7 figures,4 tables
RoRA:面向角色的区域分配,用于多模态大语言模型中的视觉令牌剪枝
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究针对多模态大语言模型视觉令牌剪枝的高开销问题,提出无训练框架RoRA,通过角色导向的区域分配实现高效剪枝,在多个模型系列上优于基线,大幅降低推理时间且保留高准确率。
Comments 9 pages, 4 figures, 4 tables. Code is available at https://github.com/LukieLuu/RoRA
解耦相似性用于大视觉-语言模型中的任务感知token剪枝
机构 * Wuhan University(武汉大学) ; University of Exeter(埃克塞特大学) ; Chinese Academy of Sciences(中国科学院) ; Xi'an University of Electronic Science and Technology(西安电子科技大学)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出DeSAP方法,通过解耦相似性实现精准任务感知token剪枝,提升大视觉-语言模型的效率与性能,实验表明在不同基准和架构上均优于现有方法。
Comments Accepted at ACM Multimedia 2026. Camera-ready version
缺失模态下的共形融合
机构 * Swinburne University of Technology(斯威本科技大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本文提出MCCF架构,解决缺失模态下的多模态融合问题,该架构兼具模态缺失鲁棒性与校准不确定性,在多基准测试中表现出良好的覆盖率与精度性能。
文本中的去偏:相信你的视觉:面向视觉反常识推理的文本锚定跨模态迁移
机构 * Ant Group(蚂蚁集团)
专题命中 其他多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对多模态大语言模型视觉反常识推理中语言先验干扰问题,提出文本锚定数据构建流程及后训练框架 TACT,实现无需视觉数据的跨模态去偏,提升模型视觉推理性能。
Hoverflie:对转子导流罩将微型飞行器转变为多模式气垫船的实验研究
机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校)
专题命中 其他多模态 :multi-modal(title,abstract)
AI总结 本研究通过设计定制转子导流罩系统,将Crazyflie 2.1微型飞行器转变为多模式机器人,开发经验模型优化导流罩配置,提升了地面效应性能并延长了续航时间,为相关后续研究提供了基础。
用于多模态行星防御的小行星破坏与偏转模拟
专题命中 其他多模态 :multi-modal(title,abstract)
AI总结 该研究针对小行星行星防御的终端场景问题,采用PI方法结合ALE3D模拟,证实20-100米级碎石堆小行星可通过特定参数的超高速钨侵彻体撞击有效减缓,为多模态行星防御提供可行方案。
Comments 9 pages, 8 figures
Journal ref Acta Astronautica, Volume 225, December 2024, Pages 960-967
RemoteZero:零样本地理空间推理
专题命中 其他多模态 :MLLM(summary_cn,abstract_cn);分类 cs.CV
AI总结 本研究提出无标签强化学习框架RemoteZero,利用MLLM的评估能力和航拍图像优势,以语义一致性为内在奖励实现地理空间推理,性能优于监督基线且可自演化,适配多类地球观测任务。
Vernata:激光雷达点表示的自监督学习
机构 * Robotics and AI Institute(机器人与人工智能研究院) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 其他多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本研究提出基于Sonata架构的Vernata自监督学习框架,通过三项扩展优化激光雷达点云表示,在多数据集上相比基线取得显著性能提升,模态减少场景下仍保持竞争力
Comments IROS 2026. Implementation: https://github.com/rai-opensource/vernata
Stockmark-Nemotron-3-Nano-Omni-JapanDocReader:基于能力注入与遗忘控制的结构化文档解析模型
机构 * Stockmark Inc.(斯托克马克公司)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CL
AI总结 本研究提出Stockmark-Nemotron-3-Nano-Omni-JapanDocReader模型,通过能力注入与遗忘控制优化结构化文档解析性能,结合混合SFT与DAPO式RL取得优于SFT的效果。
用于MRI室内经针遥操作的主从机器人操纵器
专题命中 其他多模态 :multimodal(abstract)
AI总结 该研究开发了一种MRI安全的主从机器人操纵器,可实现多模态控制,支持协作任务,经初步实验验证适用于MRI室内床边手动控制模式下的活体猪介入操作。
Comments 14 pages, 12 figures
通过基于Langevin的速度和初始化估计在流ODEs中进行采样
专题命中 其他多模态 :multimodal(abstract)
AI总结 本文提出了一种基于Langevin采样器和概率流ODE的方法,用于高效采样复杂分布并提升贝叶斯推断性能。