arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-27 至 2026-08-27 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 8 篇

2510.20803 2026-08-27 cs.CV 版本更新 84%

ARGenSeg: Image Segmentation with Autoregressive Image Generation Model

ARGenSeg:基于自回归图像生成模型的图像分割

Xiaolong Wang, Lixiang Ru, Ziyuan Huang, Kaixiang Ji, Dandan Zheng, Jingdong Chen, Jun Zhou

机构 * Ant Group(蚂蚁集团)

专题命中 多模态生成 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 该研究提出ARGenSeg框架,将图像生成融入MLLM,通过并行生成视觉令牌实现高效图像分割,在多数据集上性能优于现有方法且推理速度显著提升。

Comments Accepted to NeurIPS 2025, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25855 2026-08-27 cs.CE cs.AI 新提交 79%

Unlocking Multimodal Protein Language Models at Inference Time

在推理阶段解锁多模态蛋白质语言模型

Yi Zhou, Qipeng Wang, Yunqing Liu, Jun Xia, Qing Li, Wenqi Fan

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文建立三阶段研究框架,在不更新多模态蛋白质语言模型参数的前提下,通过优化推理阶段采样策略,揭示默认推理协议的次优性并提升其任务性能,得出与现有共识不同的基础模型相关结论。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21450 2026-08-27 cs.CE q-bio.BM 版本更新 71%

CMADiff: Cross-Modal Aligned Diffusion for Controllable Protein Generation

CMADiff: 用于可控蛋白质生成的跨模态对齐扩散

Changjian Zhou, Yuexi Qiu, Jiafeng Li, Jia Song, Wensheng Xiang

专题命中 多模态生成 :cross-modal(title)

AI总结 提出CMADiff框架,通过条件变分自编码器整合理化特征,并利用对比学习模块BioAligner对齐文本描述与蛋白质特征,实现基于文本驱动的可控蛋白质序列生成。

Comments Further improvement is needed in the content

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25138 2026-08-27 cs.LG cs.AI 新提交 57%

Drift Variation Autoencoder: Unifying Generation and Representation Learning through Conditional Posterior Flow Matching

漂移变分自编码器:通过条件后验流匹配统一生成与表示学习

Jiarui Cao

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出漂移变分自编码器,通过条件后验流匹配统一生成与表示学习,在CrossGeom-4基准上实现了高表示精度与模态一致性,完成多模态概念验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18227 2026-08-27 cs.CV 版本更新 57%

FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

FlowMimic:基于像素对扭曲流场的无掩码视觉编辑与生成,用于在线视频编辑数据生成及模态模仿

Dingyun Zhang, Lixue Gong, Wei Liu

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 研究探索在单一模型中整合视频和图像模态的生成与编辑能力,开发像素对时间扭曲流场实时生成视频编辑样本,设计模态模仿损失对齐模态能力,引入相关任务及损失让模型内化基于语言的视觉编辑能力。

Comments Due to file size constraints, the figures in the arXiv file have been heavily lossy-compressed. Please visit the uncompressed file at: this https URL (https://huggingface.co/datasets/FlowMimic/Uncompressed/blob/main/main.pdf)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10918 2026-08-27 cs.AI 版本更新 57%

CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation

CSPO:缓解结构化表格到LaTeX生成中的奖励模糊性

Yunfan Yang, Cuiling Lan, Jitao Sang, Yan Lu

机构 * Beijing Jiaotong University(北京交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出CSPO框架,通过分离LaTeX表格组件的优化,缓解奖励模糊性,提升结构化生成的可靠性。

Comments Accepted by ACL2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26076 2026-08-27 cs.RO 新提交 50%

Fast Generative Grasping via Lie Group-Constrained MeanFlow

基于李群约束MeanFlow的快速生成式抓取

S. Talha Bukhari, Yi Wei, Ruiqi Ni, Zachary Kingston, Aniket Bera

机构 * Purdue University(普渡大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 该研究提出基于李群约束MeanFlow的快速生成式抓取方法,可在≤5次网络评估内采样可靠抓取,在ACRONYM数据集上性能与SOTA模型相当,推理延迟达毫秒级,且无需额外训练即可迁移到真实机器人抓取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04235 2026-08-27 cs.ET 版本更新 50%

Scale-CDA: A Scalable Aftermarket Platform to Democratize Cooperative Driving Automation in Production Cars

Scale-CDA:一款用于量产车的、可扩展的原型,旨在普及AI辅助的协同驾驶自动化(CDA)

Hao Zhou, Shengming Yuan, Yuhang Wang, Alina Hagen, Haibin Wen

专题命中 多模态生成 :MLLM(abstract_cn)

AI总结 本研究提出Scale-CDA这一开源工具链,基于OpenDBC与Openpilot构建,成本低于1000美元,可实现AI辅助CDA的即插即用改装,通过多车辆测试验证了其低时延与数据隐私保护能力,为普及协同自动驾驶提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏