arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 337 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 337 篇

2606.16673 2026-07-09 cs.CV 新提交 79%

MMDiff: Extending Diffusion Transformers for Multi-Modal Generation

MMDiff: 扩展扩散变换器用于多模态生成

Yagmur Akarken, Orest Kupyn, Christian Rupprecht

机构 * University of Oxford, Visual Geometry Group(牛津大学视觉几何组)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出MMDiff框架,利用冻结的扩散变换器通过轻量解码器联合生成图像及多种密集感知模态,发现多时间步特征融合与空间变化聚合权重是关键,在语义分割等任务上取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06560 2026-07-08 cs.CV 新提交 79%

Vision as Unified Multimodal Generation

视觉作为统一的多模态生成

Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究将计算机视觉表述为统一多模态生成,SenseNova-Vision用自然语言指令等指定任务并生成多种输出。通过转换注释形成语料库训练模型,其涵盖多种视觉任务,实验显示统一模型能匹配专用系统,为集成视觉能力到通用模型提供可扩展途径。

Comments 48 pages,22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04636 2026-07-07 cs.CV 新提交 79%

Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis

通过场景感知文档合成增强关键信息提取中的大型多模态模型

Zhipeng Xu, Zulong Chen, Qing Liu, Junhao Ji, Jinxin Hu, Yipeng Yu, Jianqiang Wan, Jun Tang, Zhao Li

机构 * Alibaba Group(阿里巴巴集团) Qwen Team, Alibaba Group(阿里巴巴集团之通义千问团队) Taobao and Tmall Group, Alibaba(阿里巴巴淘宝和天猫集团) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 研究关键信息提取难题,提出场景感知文档合成框架SAYRE,利用示例文档生成训练数据,引入错误驱动生成,提升Qwen3-VL骨干性能,证明该方法是改进多模态KIE的有效数据中心方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03349 2026-07-07 cs.LG cs.AI 新提交 79%

PedestrianDiffusion: Multimodal Generative Denoising and Dense State Estimation for Inertial Navigation

行人扩散:用于惯性导航的多模态生成去噪和密集状态估计

I-Hao Lu, Dongsoo Han

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 针对消费级惯性导航受MEMS随机噪声限制问题,提出PedestrianDiffusion框架,将密集6D状态估计转化为连续条件去噪过程,引入零样本语义条件机制,用ODE求解器提升性能,在多基准测试中达先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31077 2026-07-02 cs.CV 新提交 79%

AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images

AnyMatch: 利用大规模单视图图像增强通用多模态图像匹配

Meng Yang, Zizhuo Li, Linfeng Tang, Fan Fan, Jiayi Ma

机构 * Electronic Information School, Wuhan University(武汉大学电子信息学院) School of Robotics, Wuhan University(武汉大学机器人学院)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出AnyMatch框架,利用单视图图像生成多模态训练数据,通过单目深度估计、3D重投影、扩散修复和跨模态图像翻译合成几何一致的多视图多模态图像对,构建大规模数据集Any-syn,显著提升多模态匹配网络的泛化性和鲁棒性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31959 2026-07-01 cs.CV 新提交 79%

AnyBokeh: Physics-Guided Any-to-Any Bokeh Editing with Optical Fingerprint Transfer

AnyBokeh: 物理引导的任意到任意散景编辑与光学指纹迁移

Xinyu Hou, Xiaoming Li, Zongsheng Yue, Chen Change Loy

专题命中 多模态生成 :any-to-any(title,abstract);分类 cs.CV

AI总结 提出AnyBokeh框架,通过估计源模糊状态的光学指纹并迁移到目标焦点和光圈设置,实现任意到任意散景编辑,避免全聚焦重建和测试时校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31451 2026-07-01 cs.RO cs.AI 新提交 79%

UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation

UniTac: 一种用于跨传感器触觉理解与生成的统一多模态模型

Jiahang Tu, Fengyu Yang, Chenyang Ma, Xihang Yu, Ziyao Zeng, Shaokai Wu, Hanbin Zhao, Zhi Tao, Chao Zhang, Hui Qian, Alex Wong

机构 * Zhejiang University(浙江大学) Yale University(耶鲁大学) University of Oxford(牛津大学) MIT(麻省理工学院) Shanghai Jiaotong University(上海交通大学) UNIX AI

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 提出UniTac,首个统一多模态模型,通过双级表示编码传感器和物体属性,实现触觉理解与生成,在跨传感器任务上达到最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27376 2026-06-26 cs.CV 新提交 79%

Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

Ask, Solve, Generate: 通过自一致性奖励实现自我进化的统一多模态理解与生成

Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar, Abdelrahman Shaker, Fahad Khan, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出一个自我进化的训练框架,通过内部角色(提议者、求解者、生成者)和自一致性信号,无需人工标注或外部奖励模型,同时提升统一多模态模型的理解与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26631 2026-06-26 cs.CV 新提交 79%

Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning

位置重绑定缓存复用:交错多模态推理中无重放的视觉重访

Mengzhao Wang, Yanli Ji, Wangmeng Zuo, Peng Ye, Chongjun Tu

机构 * Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute(深圳河套学院) Harbin Institute of Technology (HIT)(哈尔滨工业大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出位置重绑定缓存复用(PRCR)框架,通过重绑历史视觉KV缓存的位置坐标,实现无重放的高效视觉重访,在多个多模态推理基准上平均准确率提升5%,计算量减少数万倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24333 2026-06-24 cs.CV 新提交 79%

UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation

UniTranslator:一种用于端到端图像内机器翻译的统一多模态框架

Jiahao Lyu, Pei Fu, Zhenhang Li, Shaojie Zhang, Jiahui Yang, Yu Zhou, Can Ma, Zhenbo Luo, Jian Luan

机构 * MiLM Plus, Xiaomi Inc(小米公司MiLM Plus) Binghamton University(宾汉姆顿大学)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 提出UniTranslator统一框架,通过理解-生成对齐模块和空间掩码解码器解决翻译理解与文本编辑的冲突及空间错位问题,在多个基准上实现最先进性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21135 2026-06-23 cs.CV cs.GR cs.RO 新提交 79%

Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion

Odoriko: 一种形状感知的多模态人体运动扩散框架

Dongseok Shim, Julian Tanke, Kengo Uchida, Christian Simon, Koichi Saito, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出首个统一的多模态运动生成框架Odoriko,通过扩散模型将主体生物形态信息融入运动合成,支持文本、音乐、视频输入,并在形态缺失时联合估计与生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18249 2026-06-19 cs.CV 新提交 79%

Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification

统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键

Wujian Peng, Lingchen Meng, Yuxuan Cai, Xianwei Zhuang, Yuhuan Yang, Rongyao Fang, Chenfei Wu, Junyang Lin, Zuxuan Wu, Shuai Bai

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身AI研究院,复旦大学) Shanghai Innovation Institute(上海创新研究院) Qwen Team, Alibaba Inc.(通义实验室,阿里公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出UniAR框架,通过单一离散视觉分词器桥接视觉理解与生成,采用并行位预测和扩散解码,在图像生成和编辑上达到最优,同时保持多模态理解竞争力。

Comments ICML2026. Project page https://sharelab-sii.github.io/uniar-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17296 2026-06-17 cs.CV 新提交 79%

Pareto LoRA: Mitigating Modality Imbalance in Unified Multimodal Models via Pareto-Optimal Gradient Integration

Pareto LoRA:通过帕累托最优梯度集成缓解统一多模态模型中的模态不平衡

Xiwen Wei, Mark Nutter, Madhusudhanan Srinivasan, Radu Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Advanced Micro Devices, Inc.(超威半导体公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 针对统一多模态模型在LoRA微调中语言梯度主导优化导致图像生成质量下降的问题,提出帕累托最优梯度集成策略Pareto LoRA,通过调节梯度方向和强度平衡文本与图像目标,在CoMM基准上显著提升图像感知质量达44.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16573 2026-06-16 cs.CV 新提交 79%

Transformation-driven generation of comparable projection images from multimodal anatomical scenes

从多模态解剖场景生成可比较投影图像的变换驱动方法

Dariusz Pojda, Krzysztof Domino, Michał Tarnawski, Agnieszka Anna Tomaka

机构 * Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(波兰科学院理论与应用信息学研究所)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出变换驱动框架,从多模态解剖数据生成可重复的投影空间观测,通过下颌运动场景验证,实现不同解剖配置下直接可比的虚拟X光投影生成。

Comments 36 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07024 2026-06-08 cs.CV 新提交 79%

GuideCAD: A Lightweight Multimodal Framework for 3D CAD Model Generation via Prefix Embedding

GuideCAD: 基于前缀嵌入的轻量级多模态3D CAD模型生成框架

Minseong Kim, Jinyeong Park, Sungho Park, Jibum Kim

机构 * Convergence Research Center for Insect Vectors(昆虫传播载体汇聚研究中心) Incheon National University(仁川国立大学) Center for Brain-Machine Interface(脑机接口中心)

专题命中 多模态生成 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 提出GuideCAD框架,利用少量可训练参数通过映射网络将图像嵌入转为前缀嵌入,结合预训练大语言模型和Transformer解码器生成3D CAD模型,参数减少约4倍且训练效率提升2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06875 2026-06-08 cs.CV cs.CR 新提交 79%

Unified Safe In-context Image Generation in Multimodal Diffusion Transformers via Restricting Unsafe Information Flows

统一安全上下文图像生成:在多模态扩散变换器中通过限制不安全信息流

Xiang Yang, Feifei Li, Mi Zhang, Geng Hong, Xiaoyu You, Mi Wen, Min Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出UVR框架,通过分析注意力动态中的不安全信息流,在无需训练的情况下对输出补丁进行注意力调制,实现图像生成和编辑任务的安全控制,达到91%和77%的擦除率。

Comments ICML26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08492 2026-07-02 cs.CV cs.AI 新提交 79%

Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation

眼见为实:基于视觉锚点的提示重写对齐用于文本到图像生成

Xuanyi Liu, Deyi Ji, Junyu Lu, Jing Wang, Lanyun Zhu, Qianxiong Xu, Xuhang Chen, Tianrun Chen, Siwei Ma

机构 * Peking University(北京大学) Tencent(腾讯) Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学) University of Cambridge(剑桥大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出FaithRewriter框架,利用多模态大模型生成中间视觉线索,结合大语言模型生成视觉锚定的增强提示,再蒸馏至小模型,以缩小用户意图与生成图像之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19116 2026-08-20 cond-mat.mtrl-sci 新提交 78%

JANUS: A Multi-modal Foundation Neural Sampler for Disordered Materials

JANUS:面向无序材料的多模态基础神经采样器

Denis Blessing, Mouyang Cheng, Maximilian Schebek, Jutta Rogal, Mingda Li, Carles Domingo-Enrich, Yuanqi Du

专题命中 多模态生成 :multi-modal(title);multimodal(abstract)

AI总结 研究人员开发JANUS多模态神经采样器,用于无序材料的热力学采样,其以远少于传统方法的能量评估次数重现平衡性质,可用于合金逆设计及半导体缺陷探索,为相关研究提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23523 2026-07-28 cs.AR 新提交 78%

CircuitWeave: Topology-Behavior Alignment for Executable Multimodal RTL Generation

CircuitWeave:用于可执行多模态RTL生成的拓扑-行为对齐

Jiahao Feng, Haiyan Qin, Zhiwei Xie, Wang Kang

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 研究如何从自然语言规范生成RTL,提出CircuitWeave合同介导多模态框架,从原理图和文本提取合同并融合,通过联合目标监督相关过程,在生成可执行RTL上取得较好效果,部分指标高于无原理图的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12965 2026-07-15 cs.RO 新提交 78%

MAMMOTH: A Multi-Modal End-to-End Policy for Off-Road Mobility Robust to Missing Modality

MAMMOTH:一种对缺失模态具有鲁棒性的越野移动多模态端到端策略

Ahaan Kotian, Shivani Subramanyan, Suresh Sundaram

机构 * Indian Institute of Science(印度科学研究所)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 研究针对非结构化越野环境自主导航难题,提出MAMMOTH多模态端到端策略。它融合多模态观测,用模态丢弃训练,还采用扩散策略学习联合概率分布,经实验验证性能优越,能提升避撞等能力及对缺失模态的泛化。

Comments Accepted to IROS 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09146 2026-07-13 cs.SE 新提交 78%

Exploring the Potential of Program Flowcharts on Code Generation Using Multimodal LLMs

利用多模态大语言模型探索程序流程图在代码生成中的潜力

Yuki Toi, Tao Xiao, Kazushi Tomoto, Masanari Kondo, Yasutaka Kamei

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 研究利用多模态大语言模型探索程序流程图对代码生成的潜力,通过从示例代码生成流程图并与问题陈述一起提供给模型进行代码生成实验,发现结合流程图可提升性能,不同细节程度的流程图效果有差异,还比较了与少样本学习的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07439 2026-07-03 cs.AR 新提交 78%

A 65 nm Multi-Modal Bayesian Inference Engine with 16.3 fJ/Sample Calibration-Free GRNG for Risk-Aware At-Home Skin Lesion Screening

65 nm 多模态贝叶斯推理引擎,具有 16.3 fJ/样本免校准 GRNG,用于风险感知的家庭皮肤病变筛查

Steven Davis, Likai Pei, Jianbo Liu, Zephan M. Enciso, Boyang Cheng, Xueji Zhao, Danny Z. Chen, Ningyuan Cao

专题命中 多模态生成 :multi-modal(title);multimodal(abstract)

AI总结 提出一种65 nm风险感知多模态贝叶斯推理引擎,通过存内计算架构实现词内混合高斯采样,提升不确定性建模能力,在鲁棒性和精度上超越现有单模态贝叶斯神经网络。

Comments This paper is accepted by IEEE Transactions on Circuits and Systems - Regular Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22774 2026-06-23 physics.optics 新提交 78%

Autonomous Generation of Metamaterial Databases Based on Multimodal Agents

基于多模态代理的元材料数据库自主生成

Shilong Qin, Zhicai Yu, Xuan Zheng, Yan Zhang, Aodi Yang, Kezhan Zhao, Qi Cheng Chen, Jian Wei You, Tie Jun Cui

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 提出MetaDataGenAgent多模态多代理框架,通过文献到仿真的自动化流程,从非结构化科学文献中提取并生成元材料结构-响应数据库,实现远场波束偏转、近场全息成像等功能。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14267 2026-06-15 cs.RO 新提交 78%

FloVerse: Floor Plan-Guided Multi-Modal Navigation

FloVerse:基于楼层平面图的多模态导航

Weiqi Huang, Shuangyi Dong, Jiaxin Li, Yifei Guo, Zan Wang, Wei Liang

机构 * School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract)

AI总结 提出FloVerse任务统一PointNav、ObjectNav和ImageNav,构建FloVerse-1.6K数据集,并设计ThreeDiff两阶段模仿学习策略,利用楼层平面图先验提升导航性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27113 2026-07-30 cs.CV 新提交 77%

Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection

Veritas++:面向感知增强的AIGI检测的值感知在线策略蒸馏

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Zijian Yu, Chuanbiao Song, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) Ant Group(蚂蚁集团) Sangfor Technologies Inc.(深信服科技股份有限公司)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV

AI总结 该研究针对现有AIGI检测模型的感知瓶颈,提出Veritas++框架,通过PoRL与VaOPD机制增强感知能力,提升了检测泛化性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11886 2026-07-14 cs.CV 新提交 77%

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

读回:预训练的多模态语言模型是文本到图像生成的零样本奖励模型

Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动Seed) Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 研究提出SpectraReward将预训练多模态语言模型转为图像生成强化学习奖励模型,用图像条件提示对数似然作奖励,还引入Self-SpectraReward形成闭环框架。经广泛实验验证,二者能提升生成性能,表明奖励-策略对齐是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09303 2026-06-09 cs.CV 新提交 77%

Reason Twice: Segmentation via Candidate Discovery and Comparative Reasoning

再思考:通过候选发现与比较推理进行分割

Xinyan Gao, Haoran Hao, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出两阶段框架Rea2Seg,先基于注意力图生成候选掩码,再用多模态大语言模型推理评分,将分割转化为候选发现与判别选择,并引入新基准ReasonSeg-SGDR全面评估感知、定位与推理能力。

Comments Project page: https://snowball521.github.io/Rea2Seg-Project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30811 2026-07-01 cs.CV cs.MM cs.SD eess.AS 新提交 75%

AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

AVTok: 用于整体音视频生成的1D统一分词化

Kien T. Pham, I Chieh Chen, Qifeng Chen, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态生成 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 提出AVTok统一分词器,采用双流Transformer架构和分层训练策略,将音视频对编码为紧凑的一维潜在表示,在音视频重建及下游生成任务中表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09357 2026-08-11 cs.CV 新提交 74%

ControlRadio: Prompt-Driven Controllable Diffusion for Cross-Modal Radio Map Generation

ControlRadio:用于跨模态无线电地图生成的提示驱动可控扩散模型

Kangjun Liu, Xiying Pan, Shuhang Zhang, Xiang Xiang, Ke Chen, Yaowei Wang

机构 * Pengcheng Laboratory(鹏城实验室) South China University of Technology(华南理工大学) Peking University(北京大学) Huazhong University of Science and Technology(华中科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 多模态生成 :cross-modal(title);分类 cs.CV

AI总结 ControlRadio是一种可控生成框架,可根据自然语言描述和环境布局生成无线电地图,在不同城市场景中精度和泛化能力领先,计算时间较传统方法减少四个数量级以上,为无线环境建模提供新范式。

Comments 17 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05798 2026-08-07 cs.CV cs.LG cs.SD 新提交 74%

KVAE: Family of Tokenizers for Multimodal Generative Models

KVAE:用于多模态生成模型的分词器家族

Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov, Kirill Chernyshev, Kirill Malakhov, Ilia Vasiliev, Ilia Trushkin, Valeriya Kobenko, David Chikovani, Alexander Ivanov, Azat Saginbaev, Egor Silvestrov, Ivan Mikheev, Konstantin Zakharov

机构 * Kandinsky Lab(坎丁斯基实验室)

专题命中 多模态生成 :multimodal(title);分类 cs.CV

AI总结 本研究提出用于多模态生成模型的KVAE分词器家族,含音频、图像、视频专用型号,性能优于多款前沿开源分词器,公开了训练细节与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏