MultiModal Fine-tuning with Synthetic Captions
多模态微调与合成描述
机构 * NTT Tokyo(日本NTT东京)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出通过多模态大语言模型生成合成描述,提升多模态微调效果,尤其在少样本学习中表现优异。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
多模态微调与合成描述
机构 * NTT Tokyo(日本NTT东京)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出通过多模态大语言模型生成合成描述,提升多模态微调效果,尤其在少样本学习中表现优异。
重新思考融合:为立场检测学习解耦的共享信息和模态特定信息
专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.MM
AI总结 DiME通过解耦共享和模态特定信息提升多模态立场检测性能,采用对比学习和余弦对齐的专家模块实现更准确的立场预测。
Comments ICASSP 2026
RSGround-R1: 重新思考通过空间推理的遥感视觉定位
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(电气电子工程学院,南洋理工大学) ; MoE Key Laboratory of Interdisciplinary Research of Computation and Economics, Shanghai University of Finance and Economics(教育部计算与经济交叉学科重点实验室,上海财经大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 RSGround-R1通过引入空间推理引导的后训练框架,提升遥感图像中目标物体的定位精度与鲁棒性。
HADUA:层次注意力与动态统一对齐用于鲁棒的跨受体情绪识别
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.MM
AI总结 HADUA通过层次注意力与动态统一对齐方法,提升跨受体情绪识别的鲁棒性和准确性。
微调引导预训练提升下游性能
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 FIP通过优化目标模态的表示学习,提升多模态下游任务性能,无需额外数据或计算资源。
NetMamba+: 一种用于高效准确网络流量分类的预训练模型框架
机构 * Institute for Network Sciences and Cyberspace, Tsinghua University(网络科学与网络空间研究院,清华大学) ; Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) ; Zhongguancun Laboratory(中关村实验室) ; Central South University(中南大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 NetMamba+通过高效架构、多模态表示和标签分布感知微调,实现高效准确的网络流量分类。
ConceptMoE: 适应性令牌到概念压缩以实现隐式计算分配
机构 * ByteDance Seed(字节跳动种子)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 ConceptMoE通过动态合并语义相似令牌实现隐式计算分配,提升语言和视觉语言任务性能,同时减少计算开销。
从缓解分类能力失衡角度重新思考多模态学习
机构 * Nanjing University of Science and Technology(南京理工大学) ; State Key Lab. for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室)
专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出了一种基于提升原理的多模态学习方法,通过动态平衡弱强模态的分类能力以缓解模态不平衡问题。
Comments Accepted by NeurIPS 2025
基于路径的on-demand多模式交通系统设计的 formulations 与采纳意识
专题命中 其他多模态 :multimodal(title,abstract)
AI总结 本文提出了一种基于路径的优化模型P-Path,用于解决on-demand多模式交通系统设计中的计算难题,显著提高了求解效率。
网格神经元细胞自动机
机构 * EPFL(瑞士联邦理工学院) ; Google Research(谷歌研究)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 MeshNCA是一种无需UV映射即可实时生成高质量3D动态纹理的神经元细胞自动机方法,通过多模态监督和用户交互实现了纹理合成的泛化能力。
Comments ACM Transactions on Graphics (TOG) - SIGGRAPH 2024
Journal ref ACM Transactions on Graphics (TOG), Volume 43, Issue 4 Article No.: 122, Pages 1 - 16; 19 July 2024
迈向计算中文古文字学
专题命中 其他多模态 :multimodal(abstract);分类 cs.CL
AI总结 本文探讨了人工智能如何推动中文古文字学从孤立视觉任务向集成数字生态系统发展,强调多模态、少样本和以人为本的系统设计以解决数据稀缺和人文研究需求的挑战。
Comments A position paper in progress with Peking University & ByteDance Digital Humanities Open Lab
4D-CAAL:面向自动驾驶的4D雷达-相机校准与自动标注
机构 * School of Information Engineering, Yancheng Institute of Technology(信息工程学院,盐城职业技术学院) ; School of Navigation, Wuhan University of Technology(导航学院,武汉理工大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; School of Information Engineering, Yancheng Institute Technology(信息工程学院,盐城职业技术学院) ; School of Advanced Technology, Xi’an Jiaotong-Liverpool University(先进技术学院,西安交通大学利物浦大学) ; School of Information Science and Technology, Nantong University(信息科学与技术学院,南通大学) ; State Key Laboratory of Maritime Technology and Safety(船舶技术与安全国家重点实验室)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV
AI总结 4D-CAAL提出了一种统一框架,通过双用途校准目标和自动标注流程,实现4D雷达与相机的高精度校准,减少人工标注工作量,加速自动驾驶多模态感知系统开发。
异构垂直起降点选择优化用于按需空中出租车服务:一种深度强化学习方法
机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) ; Shanghai AI Laboratory(上海人工智能实验室) ; State Key Laboratory of Integrated Services Networks, Xidian University(西安电子科技大学集成服务网络国家重点实验室) ; Nokia Bell Labs(诺基亚贝尔实验室)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出一种基于深度强化学习的框架,用于优化空中出租车服务中的垂直起降点选择,提升城市多模式交通系统的效率和整合性。
基于透镜描述符的进化算法用于具有玻璃选择的复杂光学系统优化
专题命中 其他多模态 :multimodal(abstract)
AI总结 提出LDG-EA算法,通过行为描述符和概率模型优化复杂光学系统,生成多样化的高质量透镜设计。
设计交互记忆档案馆(IMA):一种面向AI辅助回忆和文化记忆保存的社会技术框架
专题命中 其他多模态 :multimodal(abstract)
AI总结 本文提出了一种基于AI的交互记忆档案馆框架,通过多模态感知和对话支架技术,帮助记忆丧失老年人参与回忆并保存文化记忆。
Comments 10 pages, 2 figures, 45 references cited