arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4979 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4979 篇

2510.26800 2026-07-21 cs.CV cs.GR cs.LG 版本更新 70%

OmniX: From Unified Panoramic Generation and Perception to Graphics-Ready 3D Scenes

OmniX:从统一全景生成与感知到适用于图形的3D场景

Yukun Huang, Jiwen Yu, Yanning Zhou, Jianan Wang, Xintao Wang, Pengfei Wan, Xihui Liu

机构 * University of Hong Kong(香港大学) Kuaishou Technology(快手科技) Tencent(腾讯)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究基于全景的2D提升技术,提出OmniX框架,利用跨模态适配器结构和循环空间算子,将预训练2D流匹配先验用于多模态联合建模,构建数据集,实现适用于图形的3D场景生成,为虚拟世界创建开辟新可能。

Comments ECCV 2026; Project page: https://yukun-huang.github.io/OmniX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14681 2026-07-17 cs.CV 新提交 70%

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships

ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑

Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Kling Team(克林团队) NJU(南京大学) UCAS(中国科学院大学) PKU(北京大学) HKU(香港大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究针对多参考图像条件视频编辑中现有方法难以协调多视觉源信息的问题,提出ReBind框架,通过带嵌入参考令牌的语义指令及两阶段渐进方案学习建立显式绑定,实现轻量级适配,在指令质量和性能上表现出色。

Comments Project Page: https://rebind-mrv2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14202 2026-07-17 cs.CV 新提交 70%

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

关键帧指南针:迈向对关键帧条件视频生成的全面评估

Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei Yu, Xuehai Bai, Xuanyu Zhu, Bohan Zeng, Bozhou Li, Shujie Li, Yifan Dai, Yujie Wei, Shixuan Liu, Haotian Wang, Jialu Chen, Yuanxing Zhang

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究关键帧条件视频生成,提出关键帧指南针综合基准及自动评估框架,将关键帧执行分解为六个指标评估,通过实验揭示当前模型在关键帧执行与自然视频合成间存在权衡等局限性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11470 2026-07-15 cs.CV 版本更新 70%

Sat2RealCity: Geometry-Aware and Appearance-Controllable 3D Urban Generation from Satellite Imagery

Sat2RealCity:基于卫星图像的几何感知与外观可控的3D城市生成

Xinliang Wang, Yijie Kang, Zhenyu Wu, Yifeng Shi

机构 * KE Holdings Inc.(KE控股公司) Beijing, China(中国北京)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对卫星图像3D城市生成问题,Sat2RealCity框架利用对象级3D生成先验,通过分解城市为地理定位建筑实体,结合构建的数据集,引入空间定位策略、设计外观引导机制及构建语义管道,实现良好的地理对齐、风格一致和资产合成。

Comments The first two authors contributed equally. The fourth author is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11594 2026-07-14 cs.AI cs.GR 新提交 70%

MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models

MAGIC:利用大语言模型生成具有可导航多场景的游戏世界并感知过渡

Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan, Shuqing Li, Michael R. Lyu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 研究利用大语言模型生成多场景游戏世界时面临的问题,提出MAGIC系统,通过四阶段管道将自然语言提示转化为可运行项目,解决跨场景一致性等问题,在新基准测试中表现出色,生成可执行项目且过渡识别指标优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20730 2026-07-13 cs.CV 版本更新 70%

Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback

循环渲染:通过视觉自反馈生成矢量图形

Guotao Liang, Zhangcheng Wang, Juncheng Hu, Haitao Zhou, Ziteng Xue, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北航软件学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) Paradigm(4Paradigm)

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文提出Render-in-the-Loop方法,通过视觉上下文引导矢量图形生成,提升模型对视觉信息的利用效率,实现更高效的SVG生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08377 2026-07-07 cs.CV 版本更新 70%

UniVideo: Unified Understanding, Generation, and Editing for Videos

UniVideo:视频的统一理解、生成与编辑

Cong Wei, Quande Liu, Zixuan Ye, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Wenhu Chen

机构 * University of Waterloo(多伦多大学) Kling Team, Kuaishou Technology(快手技术团队)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 提出UniVideo框架,采用双流设计,结合多模态大语言模型与多模态DiT进行视频生成等任务。统一多种视频任务于单范式,实验表明其性能出色,还支持任务组合与能力迁移,且发布了模型和代码。

Comments Project Website https://congwei1230.github.io/UniVideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16239 2026-07-07 cs.CV 版本更新 70%

EM3M: An Electron Micrograph Dataset for Microstructural Segmentation and Generation

EM3M:用于微观结构分割与生成的电子显微镜图像数据集

Nan Wang, Zhiyi Xia, Yiming Li, Siyuan Zhang, Shi Tang, Zuxin Fan, Xi Fang, Haoyi Tao, Guolin Ke, Yanhui Hong

机构 * DP Technology(DP技术)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 针对深度学习分析电子显微镜图像缺乏大规模专家标注数据集的问题,引入EM3M数据集,介绍构建过程,提供文本到图像扩散模型,评估分割方法并给出优化基线,推动自动化材料分析研究。

Comments 31 pages, 13 figures, Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05624 2026-07-03 cs.AI 版本更新 70%

ADMC: Attention-based Diffusion Model for Missing Modalities Feature Completion

ADMC: 基于注意力扩散模型的缺失模态特征补全

Yuhan Li, Wei Zhang, Juan Chen, Jiangjia Yan, Peng Xiangli, Liangze Yin

机构 * National University of Defense Technology(国防科学技术大学) The Fifth Electronic Research Institute of MIIT(信息产业部第五电子研究所) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology Beijing(北京科技大学) Hunan University(湖南大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出基于注意力扩散的缺失模态特征补全方法,通过独立训练各模态特征网络避免过耦合,利用注意力扩散网络生成与真实分布一致的缺失模态特征,在IEMOCAP和MIntRec基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30319 2026-06-30 cs.CV cs.LG 70%

BrainJanus: A Unified Model for Understanding and Generation across Brain, Vision, and Language

BrainJanus:一个统一的大脑、视觉与语言理解与生成模型

Haitao Wu, Qirui Zhang, Zhouheng Yao, Shangquan Sun, Qihao Zheng, Mianxin Liu, Chi Zhang, Wanli Ouyang, Chunfeng Song, Changqing Zhang, Jiamin Wu

专题命中 多模态生成 :multimodal(abstract);any-to-any(abstract);分类 cs.CV

AI总结 提出首个统一大脑模型BrainJanus,通过统一大脑分词器和全能自回归架构,实现脑信号与视觉、语言之间的双向编码与解码,在多个基准上取得优异性能并具备零样本泛化能力。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15490 2026-06-25 cs.CV cs.LG eess.IV 版本更新 70%

Improving Factuality of 3D Brain MRI Report Generation with Paired Image-domain Retrieval and Text-domain Augmentation

通过配对图像域检索和文本域增强提高3D脑MRI报告生成的事实准确性

Junhyeok Lee, Yujin Oh, Dahyoun Lee, Hyon Keun Joh, Minchul Kim, Chul-Ho Sohn, Sung Hyun Baik, Cheol Kyu Jung, Jung Hyun Park, Kyu Sung Choi, Byung-Hoon Kim, Jong Chul Ye

机构 * Cancer Biology, Seoul National University College of Medicine, Korea(首尔国立大学医学院癌症生物学系,韩国) Radiology, Massachusetts General Hospital(麻省总医院放射科) Harvard Medical School(哈佛医学院) Biomedical Systems Informatics, Yonsei University College of Medicine, Korea(延世大学医学院生物医学系统信息学系,韩国) Graduate School, Yonsei University, Korea(延世大学研究生院,韩国) Radiology, Seoul National University College of Medicine, Korea(首尔国立大学医学院放射科,韩国) Radiology, Seoul National University Hospital, Korea(首尔国立大学医院放射科,韩国) Radiology, Seoul National University Bundang Hospital, Korea(首尔国立大学 Bundang 医院放射科,韩国) Radiology, SMG-SNU Boramae Medical Center, Korea(SMG-SNU Boramae 医疗中心放射科,韩国) Psychiatry, Yonsei University College of Medicine, Korea(延世大学医学院精神病学系,韩国) Behavioral Sciences in Medicine, Yonsei University College of Medicine, Korea(延世大学医学院医学行为科学系,韩国) Yonsei Institute for Digital Health, Korea(延世大学数字健康研究院,韩国) Kim Jaechul Graduate School of AI, KAIST, Korea(金 Jaechul人工智能研究生院,韩国)

专题命中 多模态生成 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出PIRTA框架,通过检索相似3D DWI/ADC图像并利用其配对报告指导LLM生成,避免显式跨模态对齐,显著提高缺血区域准确性。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17030 2026-06-18 cs.CV 新提交 70%

Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation

Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界模型

Jie Zhang, Xiaoyue Chen, Anzhe Chen, Dayiheng Liu, Deqing Li, Gengze Zhou, Hale Yin, Haoqi Yuan, Haoyang Li, Jiahao Li, Jiazhao Zhang, Jingren Zhou, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Pei Lin, Qihang Peng, Shengming Yin, Tianhe Wu, Tianyi Yan, Xiao Xu, Yan Shu, Yanran Zhang, Ye Wang, Yi Wang, Yilei Chen, Yixian Xu, Yiyang Huang, Yuxiang Chen, Zekai Zhang, Zhendong Wang, Zixing Lei, Zhixuan Liang, Zihao Liu, Zikai Zhou, Chenxu Lv, Xiong-Hui Chen, Chenfei Wu

机构 * Qwen Team(Qwen团队)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出Qwen-RobotWorld,一种以自然语言为统一动作接口的语言条件视频世界模型,通过双流MMDiT、大规模具身世界知识语料和渐进式课程训练,在机器人操作、自动驾驶等任务中实现物理一致的未来视觉轨迹预测,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16767 2026-06-16 cs.CV 新提交 70%

Text-Vision Co-Instructed Image Editing

文本-视觉协同指导的图像编辑

Chenxi Xie, Yuhui Wu, Qiaosi Yi, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 多模态生成 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出TV-Edit框架,联合文本指令的语义表达与稀疏视觉指令的空间引导,实现精确且忠实于意图的图像编辑,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15982 2026-06-16 cs.CV 新提交 70%

Mind the Gap: Diagnosing Constraint Discovery Failures in Text-in-Image Editing

注意差距:诊断图像内文本编辑中的约束发现失败

Rui Gui

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 通过图像内文本编辑的受控诊断,研究多模态模型在发现未明确指定的视觉依赖约束时的失败,发现模型仅能自行发现46%的约束,而明确提供时可达94%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13679 2026-06-15 cs.CV 新提交 70%

InterleaveThinker: Reinforcing Agentic Interleaved Generation

InterleaveThinker: 强化智能体交错生成

Dian Zheng, Harry Lee, Manyuan Zhang, Kaituo Feng, Zoey Guo, Ray Zhang, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Meituan(美团) CUHK IMIXR(香港中文大学IMIXR实验室)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出首个多智能体管线InterleaveThinker,通过规划器和评论家智能体使现有图像生成器具备交错生成能力,并利用GRPO强化单步指令修正,显著提升生成性能。

Comments Project Page: https://zhengdian1.github.io/InterleaveThinker-proj/ Code: https://github.com/zhengdian1/InterleaveThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11247 2026-06-11 cs.LG cs.AI cs.AR 新提交 70%

Physics-informed generative AI for semiconductor manufacturing: Enforcing hard physical constraints in generative models by construction

物理信息驱动的生成式AI在半导体制造中的应用:通过构造强制生成模型中的硬物理约束

Yaser Mike Banad, Sarah Sharif

机构 * School of Electrical and Computer Engineering, University of Oklahoma(俄克拉荷马大学电气与计算机工程学院) Center for Quantum Research and Technology, University of Oklahoma(俄克拉荷马大学量子研究与技术中心) Intelligent Neuromorphic and Quantum Understanding for Innovative Research and Engineering (INQUIRE) Laboratory(创新研究与工程智能神经形态与量子理解实验室) Material Science and Engineering Program, University of Oklahoma, Norman, OK 73019 USA(俄克拉荷马大学材料科学与工程项目,Norman, OK 73019 USA)

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 针对半导体制造中生成模型必须满足硬物理约束的问题,本文提出通过构造集成物理信息(如物理信息扩散、PDE约束变分模型等)来强制约束,而非事后过滤,并给出四种集成模式和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04498 2026-06-09 cs.LG cs.CV 版本更新 70%

IGenBench: Benchmarking the Reliability of Text-to-Infographic Generation

IGenBench:文本到信息图生成可靠性基准测试

Yinghao Tang, Xueding Liu, Boyuan Zhang, Tingfeng Lan, Yupeng Xie, Jiale Lao, Yiyao Wang, Haoxuan Li, Tingting Gao, Bo Pan, Luoxuan Weng, Xiuqi Huang, Minfeng Zhu, Yingchaojie Feng, Yuyu Luo, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) UESTC University of Virginia(弗吉尼亚大学) HKUST(GZ)(香港科技大学(广州)) Cornell University(康奈尔大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出IGENBENCH基准,包含30种信息图类型和600个测试用例,通过多模态大语言模型分解为10类原子问题评估10种T2I模型,发现数据完整性等维度是普遍瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05949 2026-06-08 cs.CV 版本更新 70%

Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models

忠实、丰富且精确:T2I模型在自然科学插图生成中的基准测试

Yifan Chang, Jiaxin Ai, Jianwen Sun, Yuandong Pu, Siqi Luo, Liangliang Zhao, Yuchen Ren, Minghao Liu, Yunfei Yu, Yu Qiao, Kaipeng Zhang, Yihao Liu

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Nankai University(南开大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) ZODA Alaya Studio(Alaya工作室)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出FEPBench基准,通过细粒度原子集标注和三维评估(指令忠实性、推理丰富性、语义精确性)系统评估T2I模型在自然科学插图生成中的表现,发现即使最先进的闭源模型仍存在文本渲染瓶颈、推理丰富性有限以及生成丰富性与精确性难以平衡的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31530 2026-06-03 eess.AS cs.SD 70%

UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion

UNISON: 通过深度LLM融合的统一声音生成与编辑框架

Zhaoqing Li, Haoning Xu, Jingran Su, Yaofang Liu, Zhefan Rao, Huimeng Wang, Jiajun Deng, Tianzi Wang, Zengrui Jin, Rui Liu, Haoxuan Che, Xunying Liu

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) Huawei Research Hong Kong(华为香港研究)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 eess.AS

AI总结 提出UNISON,一个基于潜在扩散的统一框架,通过层间深度LLM融合和多任务架构,实现语音生成、声音生成和音频编辑,在多个任务上达到或超越专业模型性能,且参数量减少约4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28995 2026-06-02 cs.CV 70%

GAP3D: Generative Alignment of VLM Latents to Patch-Level Embeddings for 3D Generation

GAP3D: 将VLM潜在表示与补丁级嵌入进行生成式对齐以实现3D生成

Polytimi Anna Gkotsi, Andrii Zadaianchuk, Mohammad Mahdi Derakhshani

机构 * Polytimi Anna Gkotsi Andrii Zadaianchuk Mohammad Mahdi Derakhshani

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出GAP3D,一种基于扩散的模块化方法,将VLM生成的潜在表示直接对齐到预训练图像编码器的完整补丁级特征空间,使冻结的下游生成模型能够利用VLM作为提示编码器,同时保持空间结构化的条件信号,在3D资产生成中无需大规模3D数据训练,并展现出多模态提示的零样本能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17185 2026-06-01 cs.CV 70%

PostCam: Camera-Controllable Novel-View Video Generation with Query-Shared Cross-Attention

PostCam: 基于查询共享交叉注意力的相机可控新视角视频生成

Yipeng Chen, Zhichao Ye, Zhenzhou Fang, Xinyu Chen, Xiaoyu Zhang, Jialing Liu, Nan Wang, Guofeng Zhang, Haomin Liu

机构 * State Key Lab of CAD\&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) Shanghai InSpatio Intelligent Technology Co., Ltd.(上海InSpatio智能技术有限公司)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出PostCam框架,通过查询共享交叉注意力机制对齐6自由度姿态和渲染特征,实现动态场景中高细节保持和精确相机轨迹编辑的新视角视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27607 2026-05-29 cs.CV cs.RO 70%

Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model

双流扩散用于世界模型增强的视觉-语言-动作模型

John Won, Kyungmin Lee, Huiwon Jang, Dongyoung Kim, Jinwoo Shin

机构 * Kim Jaechul Graduate School of AI, Korea Advanced Institute of Technology, Seoul, Republic of Korea(金 Jaechul 人工智能研究生院,韩国科学技术院,首尔,大韩民国)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出DUST框架,通过双流扩散Transformer和异步采样方法,解决世界模型增强的视觉-语言-动作模型中的模态差距问题,在模拟和真实任务中取得显著性能提升。

Comments Accepted at ICML 2026. Project page at https://periphanes.github.io/dust (20 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18084 2026-05-27 cs.AI 70%

Property Enhanced Instruction Tuning for Multi-task Molecule Generation with Large Language Models

属性增强指令微调用于大型语言模型的多任务分子生成

Xuan Lin, Long Chen, Yile Wang, Yangyang Chen, Xiangxiang Zeng

机构 * School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Department of Computer Science, University of Tsukuba(东京大学理工学部) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 提出PEIT框架,通过多模态对齐预训练和指令微调,提升LLM在分子描述、文本分子生成、属性预测和多约束分子生成任务上的性能。

Comments 9

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24624 2026-05-26 cs.CV 70%

Vision-Language Binding in In-Context Image Generation

上下文图像生成中的视觉-语言绑定

Chris Ge, Rohit Gandikota, Antonio Torralba, Tamar Rott Shaham

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Northeastern University(东北大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文通过因果干预方法揭示FLUX.2模型中文本令牌与参考图像之间的隐式跨模态绑定机制,并定位绑定发生在文本序列的填充令牌上。

Comments 35 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12455 2026-05-25 cs.CV 70%

Mitigating Object Hallucinations via Sentence-Level Early Intervention

通过句子级早期干预缓解对象幻觉

Shangpin Peng, Senqiao Yang, Li Jiang, Zhuotao Tian

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出SENTINEL框架,通过句子级早期干预和领域内偏好学习,无需人工标注即可显著减少多模态大语言模型的对象幻觉,并在幻觉和通用能力基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11499 2026-05-21 cs.CV 70%

What if Agents Could Imagine? Reinforcing Open-Vocabulary HOI Comprehension through Generation

如果智能体能够想象?通过生成强化开放词汇人-物交互理解

Zhenlong Yuan, Yue Wang, Dapeng Zhang, Kejin Cui, Rui Chen, Jing Tang, Lei Sun, Hongwei Yu, Chengxuan Qian, Xiangxiang Chu, Shuo Li, Yuyin Zhou

机构 * Dream-X Team(Dream-X团队) Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究者) Case Western Reserve University(凯斯西储大学) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出ImagineAgent框架,通过生成式世界建模和工具增强强化学习,解决开放词汇人-物交互理解中的跨模态幻觉和视角限制问题,实现了高效且鲁棒的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20147 2026-05-20 cs.CV 70%

PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality Dataset

PixVerve:通过大规模高质量数据集将原生超高清图像生成推至100MP

Haojun Chen, Haoyang He, Chengming Xu, Qingdong He, Junwei Zhu, Yabiao Wang, Zhucun Xue, Xianfang Zeng, Zhennan Chen, Xiaobin Hu, Hao Zhao, Yong Liu, Jiangning Zhang, Dacheng Tao

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出PixVerve-95K数据集,通过精心设计的数据管道构建,包含95K张高分辨率图像和七维标注,用于推动超高清图像生成技术,通过三种训练方案将T2I基础模型扩展到100MP生成,并建立PixVerve-Bench评估协议。

Comments Project page is available at https://haojunchen663.github.io/projects/PixVerve/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17042 2026-05-19 cs.CV 70%

Thermal-Only Crowd Counting with Deployment-Time Privacy Protection

仅热成像的人群计数与部署时隐私保护

Yifei Qian, Zhongliang Guo, Chun Tong Lei, Bowen Deng, Chun Pong Lau, Xiaopeng Hong, Michael P. Pound

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) School of Computer Science, University of St Andrews(斯特灵大学计算机科学学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种仅使用热成像数据的人群计数框架,通过消除RGB数据依赖,减少公共监控中隐私暴露风险,并利用深度到RGB扩散模型来缓解热成像的模糊性,提升计数准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16603 2026-05-19 cs.CV 70%

Controlla: Learning Controllability via Graph-Constrained Latent Geometry

Controlla:通过图约束潜在几何学习可控性

Jamuna S. Murthy, Amin Karimi Monsefi, Rajiv Ramnath

机构 * Ramaiah Institute of Technology(拉马亚院技术学院) The Ohio State University(俄亥俄州立大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Controlla通过图约束潜在几何学习可控性,结合图约束最优传输对多模态输入的语义属性和身份因子进行对齐,提升可控性、身份保持和跨模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14594 2026-05-15 cs.CV cs.GR 70%

TOPOS: High-Fidelity and Efficient Industry-Grade 3D Head Generation

TOPOS: 高保真且高效的工业级3D人脸生成

Bojun Xiong, Zoubin Bi, Xinghui Peng, Yunmu Wang, Junchen Deng, Jun Liang, Jing Li, Bowen Cai, Huan Fu

机构 * HUJING Digital Media & Entertainment Group(华景数字媒体与娱乐集团)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 TOPOS框架通过统一拓扑结构实现单图像条件下的3D人脸生成,生成具有固定拓扑的高保真人脸网格,提升顶点级对应一致性,优于传统方法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏