vLLM-Omni: Fully Disaggregated Serving for Any-to-Any Multimodal Models
vLLM-Omni: 任何到任何多模态模型的完全解耦服务
专题命中 多模态生成 :multimodal(title,abstract);any-to-any(title,abstract)
AI总结 vLLM-Omni通过解耦服务系统优化多模态模型的高效服务,显著提升作业完成时间效率。
Comments 12 pages, 8 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
vLLM-Omni: 任何到任何多模态模型的完全解耦服务
专题命中 多模态生成 :multimodal(title,abstract);any-to-any(title,abstract)
AI总结 vLLM-Omni通过解耦服务系统优化多模态模型的高效服务,显著提升作业完成时间效率。
Comments 12 pages, 8 figures
量化统一多模态模型中理解与生成之间的差距
机构 * University of Maryland(马里兰大学) ; University of Waterloo(滑铁卢大学) ; MBZUAI
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL
AI总结 本研究通过GapEval基准量化统一多模态模型中理解与生成能力的差距,揭示当前模型仅实现表面层次的统一,而非深度认知融合。
GHOST:诱导幻觉的多模态大语言模型图像生成
机构 * The University of Melbourne(墨尔本大学) ; University of Maryland(马里兰大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 GHOST通过优化隐蔽令牌生成诱导幻觉的图像,评估多模态大语言模型的可靠性,并发现高幻觉成功率及可转移漏洞。
Q Cache:视觉注意力在少于一半的解码层中具有价值用于多模态大语言模型
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 Q Cache通过跨层共享相似注意力模式,减少多模态大语言模型中的KV缓存使用量,提升吞吐量并保持性能
Comments Accepted by AAAI26
多模态科学学习超越扩散与流
机构 * Graduate Group in Applied Mathematics and Computational Science(应用数学与计算科学联合研究生组) ; Department of Computer and Information Science(计算机与信息科学系) ; Department of Mechanical Engineering and Applied Mechanics(机械工程与应用力学系)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出混合密度网络作为多模态科学学习中更高效、更稳定的替代方法,实现对科学问题中多模态不确定性的有效建模与解决。
RMFlow:通过噪声注入步骤细化均流以实现多模态生成
机构 * Department of Mathematics and Scientific Computing and Imaging (SCI) Institute University of Utah(数学与科学计算及成像学院(SCI)院,犹他大学) ; Department of Mathematics, UCLA(数学系,加州大学洛杉矶分校)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 RMFlow通过引入噪声注入步骤,改进均流模型,实现高效多模态生成,仅需单次功能评估即可达到接近最先进的性能。
Comments Accepted to ICLR 2026
WordCraft: 通过多模态大语言模型 scaffolding 关键词方法用于L2词汇学习
机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) ; School of Creativity and Art, ShanghaiTech University(创意与艺术学院,上海科技大学) ; Shanghai Fengxian Dai Wen Middle School(上海奉贤戴文中学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL
AI总结 WordCraft通过多模态大语言模型辅助L2词汇学习,提升关键词方法的使用效果和学习者参与度。
Comments Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI' 26), April 13--17, 2026, Barcelona, Spain
高效无人机轨迹预测:一种多模态深度扩散框架
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
AI总结 本文提出一种多模态深度融合框架,通过融合激光雷达和毫米波雷达数据提升无人机轨迹预测精度,实验显示其比基线模型提升40%。
Comments in Chinese language
在黎曼流形上采样多模分布的无训练随机插值法
机构 * CMAP, CNRS, Ecole polytechnique(CMAP、法国国家科学研究中心、巴黎高等师范学院)
专题命中 多模态生成 :multi-modal(title,abstract)
AI总结 本文提出了一种无训练的随机插值方法,用于在黎曼流形上高效采样多模分布,通过非平衡动力学和随机插值实现无需训练的高效采样。
一种评估和增强多模态大语言模型在文化情境任务中解释能力的结构框架
机构 * DJCAD, University of Dundee, United Kingdom(邓迪大学DJCAD部门) ; ARG-tech, SSEN, University of Dundee, United Kingdom(邓迪大学) ; School of Computer Science, University of Birmingham, United Kingdom(伯明翰大学计算机科学学院)
专题命中 多模态生成 :multimodal(title);分类 cs.CL
AI总结 本研究提出了一种结构框架,用于评估和增强多模态大语言模型在文化情境任务中生成中国绘画批评的能力,通过量化评价特征和人设引导提示,揭示了VLMs在艺术批评领域的表现与局限。
Comments EMNLP 2025 submission, 10 pages, 6 figures, 5 tables
Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 1945-1971, Suzhou, China
MAUGen: 一种用于多身份面部表情和AU标签生成的统一扩散方法
专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 MAUGen通过统一的扩散方法生成多身份面部表情和AU标签,提升面部动作单元识别系统的泛化能力。
Omni-Judge: 能否将 Omni-LLMs 用作文本条件音频视频生成的人类对齐裁判?
机构 * University of Rochester(罗切斯特大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校)
专题命中 多模态生成 :multi-modal(abstract);omni-modal(abstract);分类 cs.CV
AI总结 Omni-Judge 评估 Omni-LLMs 是否能作为文本条件音频视频生成的人类对齐裁判,展现其在多模态评估中的潜力与局限。
弥合词汇歧义与视觉:关于视觉词义消歧的简要综述
机构 * School of Computing Informatics(计算与信息学学院) ; Institute of Technology(技术研究所)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本文综述了视觉词义消歧的发展,探讨了对比模型和LLM在解决词汇歧义中的作用,并指出未来发展方向。
Comments 2 figures, 2 Tables, Accepted at IEEE TIC 2026
Mind-Brush: 将代理认知搜索与推理整合到图像生成中
机构 * Sun Yat-sen University(中山大学) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 Mind-Brush通过整合代理认知搜索与推理,提升图像生成模型对复杂知识推理和动态适应能力,实现性能显著跃升。
Comments 36 pages, 24 figures
扩散模型中自适应域偏移用于跨模态图像翻译
机构 * Laplace Lab at University of Tennessee(田纳西大学Laplace实验室) ; University of California Riverside(加州大学河滨分校) ; University of Tennessee at Chattanooga(田纳西大学查塔努加分校)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出了一种自适应域偏移方法,通过在扩散模型生成过程中嵌入域偏移动态,提升跨模态图像翻译的结构保真度和语义一致性。
Comments Paper accepted as a conference paper at ICLR 2026
T2M Mamba:基于运动周期性与显著性耦合的稳定文本驱动运动生成方法
机构 * Shenzhen University(深圳大学) ; Jinan University(济南大学)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 T2M Mamba通过周期性-显著性耦合方法,解决文本驱动运动生成中的周期性漂移和语义脆弱性问题,实现更稳定的运动生成。
Comments 8 pages,5 figures
StoryState: 基于代理的状态控制用于一致且可编辑的故事书
机构 * Birbhum Institute of Engineering and Technology(比尔布尔工程科技学院) ; Universiti Malaya(马来亚大学) ; City University of Hong Kong(香港城市大学) ; Wake Forest University(威克森林大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 StoryState通过基于代理的状态控制实现多页故事书的一致性与编辑优化
ReLayout: 通过关系感知的设计重建实现多功能且结构保持的设计布局编辑
机构 * Xi'an Jiaotong University, Xi'an, China(西安交通大学) ; Microsoft Research(微软研究院)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 ReLayout通过关系感知设计重建实现多功能且结构保持的设计布局编辑,无需三元组数据,提升编辑质量和结构保持性。
SPARK: 基于亲和力引导的随机游走进行无监督分割的随机传播
机构 * International Laboratory on Learning Systems (ILLS)(学习系统国际实验室)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 SPARK通过随机传播和亲和力引导的随机游走,实现无监督分割的高效且稳定的性能提升。
超越内容:语法性别如何塑造文本到图像模型中的视觉表示
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL
AI总结 研究揭示语法性别对文本到图像模型中视觉表示的显著影响,通过跨语言实验展示不同语法性别对性别表示的系统性影响。
PSGS:通过高斯点划法实现文本驱动的全景滑动场景生成
机构 * East China University of Science and Technology(东华大学) ; Zhejiang University(浙江大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 多模态生成 :MLLM(abstract);分类 cs.CV
AI总结 PSGS通过高斯点划法和双阶段框架实现高质量文本驱动全景场景生成,提升3D场景的真实感和细节保真度。
Comments Accepted to ICASSP2026
JSR-GFNet: 针对未来认知全球导航卫星系统干扰分类的干扰-信号比感知动态门控
机构 * National Key Laboratory of Wireless Communications, University of Electronic Science and Technology of China(中国电子科技大学无线通信国家重点实验室) ; University of Electronic Science and Technology of China(中国电子科技大学) ; Shanghai Aerospace Electronic Technology Institute(上海航天电子技术研究所) ; Shanghai Key Laboratory of Collaborative Computing in Spacial Heterogeneous Networks (CCSN)(上海空间异构网络协同计算重点实验室) ; Anhui Science and Technology University(安徽科技大学) ; University of Oxford(牛津大学) ; Shanghai Xiaoyuan Innovation center(上海小元创新中心)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI
AI总结 JSR-GFNet通过结合相位敏感的IQ样本与STFT频谱图,利用动态门控机制提升GNSS干扰分类的准确性和鲁棒性。
LMTE:利用语言模型进行WAN流量工程中的推理
专题命中 多模态生成 :multimodal(abstract)
AI总结 LMTE利用语言模型进行WAN流量工程,通过高效多模态对齐和轻量级配置生成,实现更高效的流量规划和优化。
Comments Accepted as a conference paper at IEEE INFOCOM 2026
物理引导的扩散Mamba变换器用于现实驾驶
机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology(Guangzhou)(香港科学与技术大学(广州)机器人与自主系统方向) ; MoSense Technologies
专题命中 多模态生成 :multi-modal(abstract)
AI总结 本文提出了一种结合Mamba和注意力机制的扩散模型,通过整合物理约束提升自动驾驶轨迹预测的准确性和可解释性。
Journal ref International Conference on Robotics & Automation (ICRA) 2026
SynCoGen: 通过联合反应和坐标建模实现可合成的3D分子生成
机构 * University of Toronto(多伦多大学) ; The Hospital for Sick Children(多伦多儿童医院) ; University of Cambridge(剑桥大学) ; ETH Zürich(苏黎世联邦理工学院) ; Vector Institute(向量研究所) ; Mila – Quebec AI Institute(魁北克AI研究所) ; McGill University(麦吉尔大学) ; Caltech(加州理工学院)
专题命中 多模态生成 :multimodal(abstract)
AI总结 SynCoGen通过联合反应和坐标建模实现可合成的3D分子生成,实现了分子构建块、化学反应和原子坐标的联合分布采样,在无条件小分子生成和药物发现中表现出色。
Comments ICLR 2026