arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-13 至 2026-01-13 共收录 92 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 10 篇

2601.06566 2026-01-13 cs.CV cs.AI 84%

QCaption: Video Captioning and Q&A through Fusion of Large Multimodal Models

QCaption: 通过融合大多模态模型实现视频描述与问答

Jiale Wang, Gee Wah Ng, Lee Onn Mak, Randall Cher, Ng Ding Hei Ryan, Davis Wang

机构 * Department of Computer Science and Engineering, Nanyang Technological University, Singapore(南洋理工大学计算机科学与工程系)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 QCaption通过融合关键帧提取、多模态模型和语言模型,提升视频描述和问答任务的性能,实现44.2%和48.9%的改进。

Journal ref Proceedings of the 27th International Conference on Information Fusion (FUSION), 2024, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06424 2026-01-13 cs.CL 79%

Can a Unimodal Language Agent Provide Preferences to Tune a Multimodal Vision-Language Model?

单模语言代理能否为调整多模态视觉-语言模型提供偏好?

Sazia Tabasum Mim, Jack Morris, Manish Dhakal, Yanming Xiu, Maria Gorlatova, Yi Ding

机构 * Georgia State University(佐治亚州立大学) Duke University(杜克大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出通过单模语言代理提供偏好反馈,提升多模态视觉-语言模型的描述能力,实验显示在准确率上提升13%,且人类偏好匹配率达64.6%。

Comments Accepted to IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07359 2026-01-13 cs.CV cs.AI 62%

Seeing Right but Saying Wrong: Inter- and Intra-Layer Refinement in MLLMs without Training

看到正确却说错:在MLLMs中无需训练的跨层和内层细化

Shezheng Song, Shasha Li, Jie Yu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DualPD通过双视角解码细化策略,无需额外训练提升多模态大语言模型的视觉理解准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07291 2026-01-13 cs.CV cs.AI 62%

A Visual Semantic Adaptive Watermark grounded by Prefix-Tuning for Large Vision-Language Model

基于前缀微调的视觉语义自适应水印

Qi Zheng, Shuliang Liu, Yu Huang, Sihang Jia, Jungang Li, Lyuhao Chen, Junhao Chen, Hanqian Li, Aiwei Liu, Yibo Yan, Xuming Hu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VISA-Mark,一种基于前缀微调的视觉语义自适应水印方法,通过动态视觉证据权重提升视觉与语义保真度,实现高效且可靠的多模态水印技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06847 2026-01-13 cs.CV cs.AI 62%

MedGround: Bridging the Evidence Gap in Medical Vision-Language Models with Verified Grounding Data

MedGround: 通过验证的 grounding 数据弥合医学视觉-语言模型中的证据差距

Mengmeng Zhang, Xiaoping Wu, Hao Luo, Fan Wang, Yisheng Lv

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) Hupan Lab, Zhejiang Province(浙江省 Hupan 实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MedGround通过生成高质量的医学指称 grounding 数据,提升视觉-语言模型在临床场景中的定位和泛化能力。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06475 2026-01-13 cs.CV cs.AI 62%

VVTRec: Radio Interferometric Reconstruction through Visual and Textual Modality Enrichment

VVTRec: 通过视觉和文本模态增强进行无线电干涉图重建

Kai Cheng, Ruoqi Wang, Qiong Luo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VVTRec通过融合视觉和文本模态增强,提升无线电干涉图重建的图像质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06222 2026-01-13 cs.CV cs.AI 62%

SAPL: Semantic-Agnostic Prompt Learning in CLIP for Weakly Supervised Image Manipulation Localization

SAPL: CLIP中基于语义无关的提示学习用于弱监督图像篡改定位

Xinghao Wang, Changtao Miao, Dianmo Sheng, Tao Gong, Qi Chu, Nenghai Yu, Quanchen Zou, Deyue Zhang, Xiangzheng Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SAPL通过语义无关的提示学习和边缘信息利用,提升CLIP在弱监督图像篡改定位中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11169 2026-01-13 cs.CL cs.AI 62%

Correcting misinformation on social media with a large language model

利用大型语言模型纠正社交媒体上的虚假信息

Xinyi Zhou, Ashish Sharma, Amy X. Zhang, Tim Althoff

机构 * Paul G. Allen School of Computer Science and Engineering, University of Washington(保罗·G·阿伦计算机科学与工程学院,华盛顿大学) Computer Science Department, Boise State University(计算机科学系,博伊西州立大学) Microsoft Corporation(微软公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 MUSE通过结合视觉语言模型和网络检索,有效纠正社交媒体上的虚假信息,优于GPT-4和社交媒体用户回复。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05269 2026-01-13 cs.IR cs.CV cs.LG 57%

Studying Illustrations in Manuscripts: An Efficient Deep-Learning Approach

研究手稿中的插图:一种高效的深度学习方法

Yoav Evron, Michal Bar-Asher Siegal, Michael Fire

机构 * Faculty of Computer and Information Science, Ben-Gurion University of the Negev, Be’er Sheva, Israel(计算机与信息科学学院,内盖夫本· Gurion大学,贝尔谢巴,以色列) The Goldstein-Goren Department of Jewish Thought, Ben-Gurion University of the Negev, Be’er Sheva, Israel(犹太思想Goldstein-Goren部门,内盖夫本· Gurion大学,贝尔谢巴,以色列)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种高效的深度学习方法,用于大规模分析历史插图手稿,通过多模态描述和共享表示空间揭示视觉模式和跨手稿关系。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19142 2026-01-13 cs.CV 57%

CLIP-GS: Unifying Vision-Language Representation with 3D Gaussian Splatting

CLIP-GS: 通过3D高斯点划法统一视觉-语言表示

Siyu Jiao, Haoye Dong, Yuyang Yin, Zequn Jie, Yinlong Qian, Yao Zhao, Humphrey Shi, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) National University of Singapore(新加坡国立大学) Meituan(美团) Georgia Institute of Technology(佐治亚理工学院) Picsart AI Research (PAIR)(Picsart AI研究(PAIR))

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 CLIP-GS通过3D高斯点划法统一视觉-语言表示,利用对比损失和图像投票损失提升多模态检索和分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2305.07216 2026-01-13 cs.LG cs.MM cs.SD eess.AS 84%

Versatile audio-visual learning for emotion recognition

多功能音频视觉学习用于情绪识别

Lucas Goncalves, Seong-Gyun Leem, Wei-Cheng Lin, Berrak Sisman, Carlos Busso

机构 * Multimodal Signal Processing (MSP) Lab(多模态信号处理实验室) Erik Jonsson School of Engineering and Computer Science(埃里克·乔纳森工程与计算机科学学院) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.MM、eess.AS

AI总结 本文提出VAVL框架,通过共享层和残差连接实现灵活的音频视觉学习,提升情绪识别和预测性能。

Comments 18 pages, 4 Figures, 3 tables (published at IEEE Transactions on Affective Computing)

Journal ref IEEE Transactions on Affective Computing 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20166 2026-01-13 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data

从对齐到提升:通过合成数据 bootstrap 音频-语言对齐

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出BALSa框架,通过合成数据生成提升音频-语言对齐能力,缓解幻觉问题并增强模型理解与推理性能。

Comments Published in IEEE Transactions on Audio, Speech, and Language Processing (TASLP). Project Website: https://kuan2jiu99.github.io/Balsa

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 4604-4619, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06774 2026-01-13 cs.HC 50%

ImmuniFraug: A Metacognitive Intervention Anti-Fraud Approach to Enhance Undergraduate Students' Cyber Fraud Awareness

ImmuniFraug:一种基于元认知干预的反欺诈方法,以提高本科生的网络欺诈意识

Xiangzhe Yuan, Jiajun Wang, Huanchen Wang, Qian Wan, Siying Hu

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 ImmuniFraug通过基于LLM的多模态欺诈模拟,提升本科生网络欺诈意识和自我效能感,提供更有效的反欺诈教育方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 8 篇

2601.06573 2026-01-13 cs.AI cs.MM 81%

QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models

QMAVIS:利用大多模态模型融合实现长视频音频理解

Zixing Lin, Jiale Wang, Gee Wah Ng, Lee Onn Mak, Chan Zhi Yang Jeriel, Jun Yang Lee, Yaohao Li

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 QMAVIS通过融合大型多模态模型、大型语言模型和语音识别模型,实现了长视频音频理解,展示了在VideoMME数据集上38.75%的性能提升,并在其他数据集上表现出竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06843 2026-01-13 cs.CV cs.CL 81%

Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models

边看边说:解锁多模态大语言模型的实时视频理解能力

Junyan Lin, Junlong Tong, Hao Wu, Jialiang Zhang, Jinming Liu, Xin Jin, Xiaoyu Shen

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT) Shanghai Jiao Tong University(上海交通大学) Ocean University of China(中国海洋大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出并行流式框架,通过三种设计解决多模态大语言模型在实时视频理解中的位置连续性约束问题,实现边看边说的实时交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22393 2026-01-13 cs.CV cs.LG 79%

Gems: Group Emotion Profiling Through Multimodal Situational Understanding

GEMS: 通过多模态情境理解进行群体情绪分析

Anubhav Kataria, Surbhi Madan, Shreya Ghosh, Tom Gedeon, Abhinav Dhall

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 GEMS通过多模态情境理解实现群体情绪分析,预测个体、群体和事件层面的情绪,提供更细粒度和整体的分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04376 2026-01-13 cs.CV 70%

Combining Facial Videos and Biosignals for Stress Estimation During Driving

结合面部视频和生物信号用于驾驶过程中的压力估计

Paraskevi Valergaki, Vassilis C. Nicodemou, Iason Oikonomidis, Antonis Argyros, Anastasios Roussos

机构 * Computer Science Department, University of Crete(塞萨洛尼基大学计算机科学系) Institute of Computer Science (ICS), Foundation for Research & Technology – Hellas (FORTH)(希腊基础研究与技术机构计算机科学研究所)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出结合面部视频和生物信号的多模态压力估计框架,通过跨模态注意力融合显著提升性能,适用于驾驶场景的压力监测。

Comments Under submission to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06257 2026-01-13 q-bio.NC cs.AI cs.CV 62%

Gamma2Patterns: Deep Cognitive Attention Region Identification and Gamma-Alpha Pattern Analysis

Gamma2Patterns: 深度认知注意力区域识别与伽马-阿尔法模式分析

Sobhana Jahan, Saydul Akbar Murad, Nick Rahimi, Noorbakhsh Amiri Golilarz

机构 * 1Department of Computer Science, The University of Alabama, Tuscaloosa, AL, USA 2School of Computing Sciences \& Computer Engineering, University of Southern Mississippi, Hattiesburg, MS, USA Email

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Gamma2Patterns通过多模式分析揭示深度注意力的神经区域和振荡特征,为人工智能系统中的注意力机制提供神经生理学基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07366 2026-01-13 cs.CV 57%

HiVid-Narrator: Hierarchical Video Narrative Generation with Scene-Primed ASR-anchored Compression

HiVid-Narrator:基于场景优先的ASR锚定压缩的分层视频叙事生成

Haoxuan Li, Mengyan Li, Junjun Zheng

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 HiVid-Narrator通过分阶段构建和SPA-Compressor压缩技术,在减少输入标记的同时生成高质量的电子商务视频叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07290 2026-01-13 cs.CV 57%

VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding

VideoLoom:一种用于联合空间-时间理解的视频大语言模型

Jiapeng Shi, Junke Wang, Zuyao You, Bo He, Zuxuan Wu

机构 * Fudan University(复旦大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 VideoLoom是一种用于联合空间-时间理解的视频大语言模型,通过LoomData-8.7k数据集和LoomBench基准测试,在多个视频理解任务中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07558 2026-01-13 cs.RO 50%

FlyCo: Foundation Model-Empowered Drones for Autonomous 3D Structure Scanning in Open-World Environments

FlyCo:基于基础模型的无人机自主3D结构扫描系统

Chen Feng, Guiyong Zheng, Tengkai Zhuang, Yongqian Wu, Fangzhan He, Haojia Li, Juepeng Zheng, Shaojie Shen, Boyu Zhou

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子与计算机工程系) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) Differential Robotics, Hangzhou, China(杭州差分机器人)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 FlyCo通过整合基础模型实现无人机自主3D扫描,提升开放世界环境下的目标定位与预测效率。

Comments 34 pages, 24 figures, 9 tables. Video: https://www.youtube.com/playlist?list=PLqjZjnqsCyl40rw3y15Yzc7Mdo-z1y2j8

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2601.07329 2026-01-13 cs.CL 83%

BayesRAG: Probabilistic Mutual Evidence Corroboration for Multimodal Retrieval-Augmented Generation

BayesRAG: 基于概率互证的多模态检索增强生成

Xuan Li, Yining Wang, Haocai Luo, Shengping Liu, Jerry Liang, Ying Fu, Weihuang, Jun Yu, Junnan Zhu

机构 * University of Science and Technology of China(中国科学技术大学) Unisound AI Technology Co.Ltd(Unisound AI技术有限公司) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 BayesRAG通过概率互证机制提升多模态检索增强生成的性能,有效解决异构模态的隔离问题。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09681 2026-01-13 cs.IR cs.AI cs.CL cs.LG 62%

DB3 Team's Solution For Meta KDD Cup' 25

DB3团队的Meta KDD杯'25解决方案

Yikuan Xia, Jiazun Chen, Yirui Zhan, Suifeng Zhao, Weipeng Jiang, Chaorui Zhang, Wei Han, Bo Bai, Jun Gao

机构 * Key Laboratory of High Confidence Software Technologies, CS, Peking University, China(高可信软件技术重点实验室,中国科学院,北京大学) Theory Lab, Central Research Institute, 2012 Labs, Huawei Technologies Co., Ltd, Shenzhen, China(理论实验室,中央研究院,2012实验室,华为技术有限公司,深圳)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 DB3团队通过多模态检索框架和拒绝训练方法,在KDD杯'25的CRAG-MM挑战中取得优异成绩,尤其在处理第一人称视角问题上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07333 2026-01-13 cs.CV cs.RO 57%

OSCAR: Open-Set CAD Retrieval from a Language Prompt and a Single Image

OSCAR: 从语言提示和单张图像进行开放集CAD检索

Tessa Pulli, Jean-Baptiste Weibel, Peter Hönig, Matthias Hirschmanner, Markus Vincze, Andreas Holzinger

机构 * BOKU University, Human-Centered AI Lab, FTEC, Department for Ecosystem Management, Climate(博乐大学,以人为中心的人工智能实验室,FTEC,生态系统管理部,气候) Institute for Human Centered Computing, Faculty of Informatics(以人为中心的计算研究所,信息学院) Biomedical Engineering, TU Graz, Graz, Austria(生物医学工程,格拉茨技术大学,格拉茨,奥地利)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 OSCAR通过语言提示和单张图像实现开放集CAD检索,无需训练即可在未标记数据库中检索匹配对象模型,提升6D物体姿态估计的自动化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06496 2026-01-13 cs.CV 57%

3D CoCa v2: Contrastive Learners with Test-Time Search for Generalizable Spatial Intelligence

3D CoCa v2:基于测试时间搜索的对比学习用于通用空间智能

Hao Tang, Ting Huang, Zeyu Zhang

机构 * School of Computer Science, Peking University(北京大学计算机学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 3D CoCa v2通过测试时间搜索提升3D场景描述的泛化能力,实现对比学习与描述生成的统一,提高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 13 篇

2601.06792 2026-01-13 cs.LG 82%

Cross-Modal Computational Model of Brain-Heart Interactions via HRV and EEG Feature

通过HRV和EEG特征实现脑心交互的跨模态计算模型

Malavika Pradeep, Akshay Sasi, Nusaibah Farrukh, Rahul Venugopal, Elizabeth Sherly

机构 * Digital University Kerala(德里大学凯拉尔) Centre for Consciousness Studies, NIMHANS(意识研究学院,NIMHANS)

专题命中 多模态生成 :cross-modal(title,abstract);multimodal(abstract)

AI总结 本研究通过ECG和EEG特征构建跨模态模型,探索ECG信号作为认知负荷替代指标的可能性,并利用合成数据提升模型鲁棒性。

Comments 6 pages, 2 figures, Code available at: https://github.com/Malavika-pradeep/Computational-model-for-Brain-heart-Interaction-Analysis. Presented at AIHC (not published)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06049 2026-01-13 cs.CY cs.AI 79%

The Violation State: Safety State Persistence in a Multimodal Language Model Interface

违规状态:多模态语言模型接口中的安全状态持续

Bentley DeVilling

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 研究发现多模态语言模型在面对版权拒绝后,会持续拒绝无关图像生成请求,揭示了会话级安全状态的持续性问题。

Comments 19 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02763 2026-01-13 math.ST cs.NA math.NA math.PR stat.CO stat.TH 71%

Time-complexity of sampling from a multimodal distribution using sequential Monte Carlo

使用序贯蒙特卡罗方法从多模分布中采样的时间复杂度

Ruiyu Han, Gautam Iyer, Dejan Slepčev

专题命中 多模态生成 :multimodal(title)

AI总结 该研究探讨了在低温下使用序贯蒙特卡罗方法从多模分布采样的时间复杂度,分析了几何退火调度与兰格-丹德扩散的效率,并得出了收敛性的数学结果。

Comments 65 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14523 2026-01-13 cs.AI 70%

Learning from Reasoning Failures via Synthetic Data Generation

通过合成数据生成学习推理失败

Gabriela Ben Melech Stan, Estelle Aflalo, Avinash Madasu, Vasudev Lal, Phillip Howard

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.AI

AI总结 通过分析LMM推理失败生成针对性合成数据,提升多模态模型在多个下游任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00827 2026-01-13 eess.AS cs.AI cs.MM 67%

Speak the Art: A Direct Speech to Image Generation Framework

Speak the Art: 一种直接语音到图像生成框架

Mariam Saeed, Manar Amr, Farida Adel, Nada Hassan, Nour Walid, Eman Mohamed, Mohamed Hussein, Marwan Torki

专题命中 多模态生成 :image-text(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出Speak the Art框架,通过改进语音嵌入和使用扩散模型,实现更稳定和多样化的语音到图像生成,并验证了多语言扩展的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏