arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-11 至 2025-12-11 共收录 56 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 9 篇

2505.17097 2025-12-11 cs.CV cs.CL 81%

Make LVLMs Focus: Context-Aware Attention Modulation for Better Multimodal In-Context Learning

让LVLMs聚焦:基于上下文的注意力调节以提升多模态上下文学习

Yanshu Li, Jianjiang Yang, Ziteng Yang, Bozheng Li, Ligong Han, Hongyang He, Zhengtao Yao, Yingjie Victor Chen, Songlin Fei, Dongfang Liu, Ruixiang Tang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出CAMA,一种无需训练的注意力调节方法,通过动态调整注意力logits提升多模态上下文学习性能。

Comments 14 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09092 2025-12-11 cs.CV 79%

Explaining the Unseen: Multimodal Vision-Language Reasoning for Situational Awareness in Underground Mining Disasters

解释未见的:多模态视觉-语言推理用于地下矿难中的情境感知

Mizanur Rahman Jewel, Mohamed Elmahallawy, Sanjay Madria, Samuel Frimpong

机构 * Missouri University of Science and Technology(密苏里科学与技术大学) Washington State University(华盛顿州立大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MDSE框架,通过多模态视觉-语言推理提升地下矿难情境感知能力,实现更准确的描述生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09573 2025-12-11 cs.CV 70%

Investigate the Low-level Visual Perception in Vision-Language based Image Quality Assessment

研究基于视觉-语言的图像质量评估中的低级视觉感知

Yuan Li, Zitang Sun, Yen-Ju Chen, Shin'ya Nishida

机构 * Graduate School of Informatics, Kyoto University(京都大学信息科学研究生院)

专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文研究了基于视觉-语言模型的图像质量评估中低级视觉感知的问题,发现现有模型在检测基本失真时存在偏差,并通过改进视觉编码器对齐度提升失真识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07564 2025-12-11 cs.CV cs.AI cs.CL cs.LG 67%

Toward More Reliable Artificial Intelligence: Reducing Hallucinations in Vision-Language Models

迈向更可靠的人工智能:减少视觉-语言模型中的幻觉

Kassoum Sanogo, Renzo Ardiccioni

机构 * Department of CS AI and Data Science(计算机科学与数据科学系) ESEO Engineering School(ESEO工程学院) Faculty of Law, Economy, Management(法学院、经济与管理学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出无需训练的自我纠正框架,通过不确定性引导的视觉再注意力减少视觉-语言模型中的幻觉,提升响应准确性。

Comments 24 pages, 3 figures, 2 tables. Training-free self-correction framework for vision-language models. Code and implementation details will be released at: https://github.com/kassoumsanogo1/self-correcting-vlm-re-Attention.git

Journal ref The 4th National and International Academic Conference Celebrating the 20th Anniversary of Rajapruk University (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08981 2025-12-11 cs.CV cs.AI 62%

Mitigating Bias with Words: Inducing Demographic Ambiguity in Face Recognition Templates by Text Encoding

通过词语缓解偏见:通过文本编码在人脸识别模板中诱导人口统计学模糊性

Tahar Chettaoui, Naser Damer, Fadi Boutros

机构 * Fraunhofer IGD(弗劳恩霍夫研究所(IGD)) TU Darmstadt(德累斯顿技术大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 通过引入文本编码,UTIE在人脸识别模板中诱导人口统计学模糊性,以减少偏见并提升验证性能。

Comments Accepted at BMVC workshop (SRBS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09276 2025-12-11 cs.CV 57%

Dynamic Facial Expressions Analysis Based Parkinson's Disease Auxiliary Diagnosis

基于帕金森病辅助诊断的动态面部表情分析

Xiaochen Huang, Xiaochen Bi, Cuihua Lv, Xin Wang, Haoyan Zhang, Wenjing Jiang, Xin Ma, Yibin Li

机构 * School of Control Science and Engineering, Shandong University, Jinan, 250061, China(控制科学与工程学院,山东大学,济南,250061,中国) Engineering Research Center of Intelligent Unmanned System, Ministry of Education, China(智能无人系统工程研究中心,教育部,中国) Department of Geriatric Neurology, Qilu Hospital of Shandong University, Jinan, 250061, China(老年神经内科,山东大学齐鲁医院,济南,250061,中国) Shandong Inspur Science Research Institute Co., Ltd.(山东浪潮科学研究院有限公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于动态面部表情分析的帕金森病辅助诊断方法,利用多模态网络和 LSTM 分类器实现高准确率的疾病检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09215 2025-12-11 cs.CV 57%

View-on-Graph: Zero-shot 3D Visual Grounding via Vision-Language Reasoning on Scene Graphs

视图-图:通过场景图上的视觉-语言推理实现零样本3D视觉定位

Yuanyuan Liu, Haiyang Mei, Dongyang Zhan, Jiayue Zhao, Dongsheng Zhou, Bo Dong, Xin Yang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出视图-图方法,通过场景图上的视觉-语言推理实现零样本3D视觉定位,有效解决空间语义关系处理难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09927 2025-12-11 cs.RO 50%

Token Expand-Merge: Training-Free Token Compression for Vision-Language-Action Models

令牌扩展-合并:面向视觉-语言-动作模型的免训练 令牌压缩

Yifan Ye, Jiaqi Ma, Jun Cen, Zhihe Lu

机构 * College of Science and Engineering, Hamad Bin Khalifa University(1 科学与工程学院,哈马德·本·卡西姆大学) Mohamed bin Zayed University of Artificial Intelligence(2 摩萨·本·扎耶德人工智能大学) College of Computer Science and Technology, Zhejiang University(3 计算机科学与技术学院,浙江大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 TEAM-VLA通过动态令牌扩展与合并机制,实现无需训练的视觉-语言-动作模型高效推理,提升速度并保持任务性能。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09619 2025-12-11 cs.RO 50%

GLaD: Geometric Latent Distillation for Vision-Language-Action Models

GLaD:面向视觉-语言-动作模型的几何潜在蒸馏

Minghao Guo, Meng Cao, Jiachen Tao, Rongtao Xu, Yan Yan, Xiaodan Liang, Ivan Laptev, Xiaojun Chang

机构 * MBZUAI University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 图文多模态 :multimodal(abstract)

AI总结 GLaD通过引入几何意识的预训练机制,提升了视觉-语言-动作模型的空间推理和策略泛化能力,无需依赖深度传感器或3D标注。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2506.11436 2025-12-11 cs.CV 87%

TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models

TAViS: 基于文本的音频视觉分割与基础模型

Ziyang Luo, Nian Liu, Xuguang Yang, Salman Khan, Rao Muhammad Anwer, Hisham Cholakkal, Fahad Shahbaz Khan, Junwei Han

机构 * Northwestern Polytechnical University(西北工业大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract)

AI总结 TAViS通过文本桥接机制结合多模态基础模型与分割模型,实现高效的音频视觉分割与跨模态对齐。

Comments ICCV2025,code:https://github.com/Sssssuperior/TAViS

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02149 2025-12-11 cs.CV 79%

AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation

AURORA:通过结构化推理和强化学习增强参考音频视频分割

Ziyang Luo, Nian Liu, Fahad Shahbaz Khan, Junwei Han

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 AURORA通过结构化推理和强化学习提升参考音频视频分割的准确性和鲁棒性

Comments AAAI2026,code:https://github.com/Sssssuperior/AURORA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08953 2025-12-11 cs.HC cs.AI 79%

SimClinician: A Multimodal Simulation Testbed for Reliable Psychologist AI Collaboration in Mental Health Diagnosis

SimClinician: 一种多模态模拟测试平台,用于心理健康诊断中可靠的心理学家AI协作

Filippo Cenacchi, Longbing Cao, Deborah Richards

机构 * Macquarie University(麦考瑞大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 SimClinician是一种多模态模拟平台,通过整合音频、文本和目光-表情模式,帮助心理学家在心理健康诊断中与AI协作,提升诊断的准确性和交互的流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09504 2025-12-11 cs.SD 78%

DMP-TTS: Disentangled multi-modal Prompting for Controllable Text-to-Speech with Chained Guidance

DMP-TTS: 解耦多模态提示的可控文本到语音系统 with 链式引导

Kang Yin, Chunyu Qiang, Sirui Zhao, Xiaopeng Wang, Yuzhe Liang, Pengfei Cai, Tong Xu, Chen Zhang, Enhong Chen

机构 * University of Science and Technology of China(科学技术大学)

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 DMP-TTS通过解耦多模态提示和链式引导技术,实现了更强的文本到语音风格可控性,同时保持良好的可懂度和自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 7 篇

2512.09616 2025-12-11 cs.CV cs.AI cs.CL cs.LG 75%

Rethinking Chain-of-Thought Reasoning for Videos

重新思考视频中的链式推理

Yiwu Zhong, Zi-Yuan Hu, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本研究提出了一种高效的视频推理框架,通过简洁推理和减少的视觉标记提升推理效率和性能,无需依赖传统CoT注释或监督微调。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09841 2025-12-11 cs.CL cs.CV cs.MM 67%

ChronusOmni: Improving Time Awareness of Omni Large Language Models

ChronusOmni: 提升 Omni 大语言模型的时间感知能力

Yijing Chen, Yihan Wu, Kaisi Guan, Yuchen Ren, Yuyue Wang, Ruihua Song, Liyun Ru

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光荣人工智能学院) Baichuan Inc.(百川科技公司)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 ChronusOmni 通过增强时间感知能力,提升音频视觉时间定位任务的性能,实现跨模态统一建模和细粒度推理。

Comments Code available at https://github.com/YJCX330/Chronus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08979 2025-12-11 cs.CV cs.AI 62%

What Happens When: Learning Temporal Orders of Events in Videos

当什么发生时:学习视频中事件的时间顺序

Daechul Ahn, Yura Choi, Hyeonbeom Choi, Seongwon Cho, San Kim, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) Imperial College London(帝国理工学院伦敦分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MECOT方法,通过事件级描述训练和思维链提示提升视频模型对事件时间顺序的理解能力。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09354 2025-12-11 cs.CV 57%

Video-QTR: Query-Driven Temporal Reasoning Framework for Lightweight Video Understanding

Video-QTR: 一种基于查询的轻量级视频理解时序推理框架

Xinkui Zhao, Zuxin Wang, Yifan Zhang, Guanjie Cheng, Yueshen Xu, Shuiguang Deng, Chang Liu, Naibo Wang, Jianwei Yin

机构 * School of Software Technology, Zhejiang University, Hangzhou, China(浙江大学软件技术学院) School of Computer Science, Zhejiang University, Hangzhou, China(浙江大学计算机科学学院) School of Software Engineering, Xidian University, Xi’an, China(西安电子科技大学软件工程学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-QTR通过查询驱动的时序推理框架,实现轻量级视频理解,显著降低计算成本并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00702 2025-12-11 cs.HC cs.NI cs.SD eess.AS eess.IV 57%

CardioLive: Empowering Video Streaming with Online Cardiac Monitoring

CardioLive: 通过在线心脏监测增强视频流媒体

Sheng Lyu, Ruiming Huang, Sijie Ji, Yasar Abbas Ur Rehman, Lan Ma, Chenshu Wu

机构 * Department of Computer Science, The University of Hong Kong, Hong Kong SAR(香港大学计算机科学系) TCL AI Lab, Hong Kong SAR(TCL人工智能实验室)

专题命中 视频多模态 :audio-visual(abstract);分类 eess.AS

AI总结 CardioLive通过在线心脏监测技术,在视频流媒体中实现对生理信息的提取与分析,提升远程医疗和情感计算等应用的性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09608 2025-12-11 cs.RO 50%

Super4DR: 4D Radar-centric Self-supervised Odometry and Gaussian-based Map Optimization

Super4DR: 基于4D雷达的自监督里程计与高斯基于地图优化

Zhiheng Li, Weihua Wang, Qiang Shen, Yichen Zhao, Zheng Fang

专题命中 视频多模态 :multi-modal(abstract)

AI总结 Super4DR通过基于4D雷达的自监督里程计和高斯地图优化,在恶劣天气中实现更准确的定位与地图重建。

Comments 17 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09589 2025-12-11 eess.SP 50%

Temporal Windows of Integration for Multisensory Wireless Systems as Enablers of Physical AI

多感官无线系统的时间窗口集成:物理人工智能的赋能者

Anup Mishra, João Henrique Inacio de Souza, Petar Popovski

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种基于时间窗口集成和因果性的方法,用于优化物理人工智能在有限空间范围内的决策时间一致性,通过凸优化问题实现全局最优解。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 5 篇

2504.03166 2025-12-11 cs.CV 83%

RingMoE: Mixture-of-Modality-Experts Multi-Modal Foundation Models for Universal Remote Sensing Image Interpretation

RingMoE:面向通用遥感图像解释的多模态专家混合多模态基础模型

Hanbo Bi, Yingchao Feng, Boyuan Tong, Mengyu Wang, Haichen Yu, Yongqiang Mao, Hao Chang, Wenhui Diao, Peijin Wang, Yue Yu, Hanyang Peng, Yehong Zhang, Kun Fu, Xian Sun

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Target Cognition and Application Technology(TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(目标认知与应用技术重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Peng Cheng Laboratory, Shenzhen(鹏城实验室)

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 RingMoE是一种多模态专家混合模型,通过自监督学习和物理信息嵌入,提升遥感图像的多模态处理能力,实现从单模态到多模态的高效适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08995 2025-12-11 cs.HC cs.IR 78%

PoultryTalk: A Multi-modal Retrieval-Augmented Generation (RAG) System for Intelligent Poultry Management and Decision Support

PoultryTalk: 一种用于智能家禽管理与决策支持的多模态检索增强生成(RAG)系统

Kapalik Khanal, Biswash Khatiwada, Stephen Afrifa, Ranjan Sapkota, Sanjay Shah, Frank Bai, Ramesh Bahadur Bist

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 PoultryTalk是一种多模态RAG系统,通过文本和图像交互为家禽管理提供实时专家指导,实现了高准确率和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02603 2025-12-11 eess.AS cs.CL cs.SD 62%

SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation

SEAL:用于带有检索增强生成的语音大语言模型的语音嵌入对齐学习

Chunyu Sun, Bingyu Liu, Zhichao Cui, Junhan Shi, Anbin Qi, Tian-hao Zhang, Dinghao Zhou, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 SEAL通过统一的语音和文本嵌入框架,提升语音大语言模型的检索效率与准确性,减少延迟并增强多模态检索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09319 2025-12-11 cs.CE cs.AI 57%

Efficiency-Aware Computational Intelligence for Resource-Constrained Manufacturing Toward Edge-Ready Deployment

面向资源受限制造的高效计算智能:为边缘化部署而努力

Qianyu Zhou

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出高效计算框架,解决资源受限制造中的数据贫乏和物理感知问题,通过生成策略、半监督学习和边缘云协作压缩方案,提升工业部署的可靠性与效率。

Comments 2025, University of Connecticut

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09548 2025-12-11 cs.MA 50%

Supporting Dynamic Agentic Workloads: How Data and Agents Interact

支持动态代理工作负载:数据与代理如何相互作用

Ioana Giurgiu, Michael E. Nidd

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 本文提出了一种以代理为中心的数据织物,旨在高效支持动态、多模态的代理工作负载,通过注意力引导的数据检索、语义微缓存等机制提升数据处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 7 篇

2509.20427 2025-12-11 cs.CV 83%

Seedream 4.0: Toward Next-generation Multimodal Image Generation

Seedream 4.0:迈向下一代多模态图像生成

Team Seedream, :, Yunpeng Chen, Yu Gao, Lixue Gong, Meng Guo, Qiushan Guo, Zhiyao Guo, Xiaoxia Hou, Weilin Huang, Yixuan Huang, Xiaowen Jian, Huafeng Kuang, Zhichao Lai, Fanshi Li, Liang Li, Xiaochen Lian, Chao Liao, Liyang Liu, Wei Liu, Yanzuo Lu, Zhengxiong Luo, Tongtong Ou, Guang Shi, Yichun Shi, Shiqi Sun, Yu Tian, Zhi Tian, Peng Wang, Rui Wang, Xun Wang, Ye Wang, Guofeng Wu, Jie Wu, Wenxu Wu, Yonghui Wu, Xin Xia, Xuefeng Xiao, Shuang Xu, Xin Yan, Ceyuan Yang, Jianchao Yang, Zhonghua Zhai, Chenlin Zhang, Heng Zhang, Qi Zhang, Xinyu Zhang, Yuwei Zhang, Shijia Zhao, Wenliang Zhao, Wenjia Zhu

机构 * ByteDance(字节跳动)

专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 Seedream 4.0通过高效多模态框架实现文本到图像生成、图像编辑和多图像组合,展示卓越的多模态能力与高效推理性能。

Comments Seedream 4.0/4.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09610 2025-12-11 cs.HC cs.AI cs.CV 81%

ImageTalk: Designing a Multimodal AAC Text Generation System Driven by Image Recognition and Natural Language Generation

ImageTalk: 设计一种由图像识别和自然语言生成驱动的多模态AAC文本生成系统

Boyin Yang, Puming Jiang, Per Ola Kristensson

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) Department of Computing, Imperial College London(伦敦帝国学院计算机系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 ImageTalk通过图像识别和自然语言生成设计多模态AAC文本生成系统,实现95.6%的按键节省率和高用户满意度。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09271 2025-12-11 cs.CV 70%

LongT2IBench: A Benchmark for Evaluating Long Text-to-Image Generation with Graph-structured Annotations

LongT2IBench: 一个用于评估长文本到图像生成的基准,具有图结构注释

Zhichao Yang, Tianjiao Gu, Jianjie Wang, Feiyu Lin, Xiangfei Sheng, Pengfei Chen, Leida Li

专题命中 多模态生成 :multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 LongT2IBench通过图结构注释和LongT2IExpert提出,用于评估长文本到图像生成的对齐和解释能力。

Comments The paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10287 2025-12-11 cs.SD cs.CV cs.GR eess.AS 62%

MACS: Multi-source Audio-to-image Generation with Contextual Significance and Semantic Alignment

MACS:基于上下文意义和语义对齐的多源音频到图像生成

Hao Zhou, Xiaobao Guo, Yuzhe Zhu, Adams Wai-Kin Kong

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、eess.AS

AI总结 MACS通过分离多源音频并利用语义对齐提升音频到图像生成的质量和表现。

Comments Accepted at AAAI 2026. Code available at https://github.com/alxzzhou/MACS

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14499 2025-12-11 cs.CL cs.AI cs.LG 62%

Understanding World or Predicting Future? A Comprehensive Survey of World Models

理解世界还是预测未来?世界模型的全面综述

Jingtao Ding, Yunke Zhang, Yu Shang, Jie Feng, Yuheng Zhang, Zefang Zong, Yuan Yuan, Hongyuan Su, Nian Li, Jinghua Piao, Yucheng Deng, Nicholas Sukiennik, Chen Gao, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(电子工程系,信息科学与技术国家研究中心(BNRist),清华大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了世界模型在理解与预测方面的功能,探讨了其在多个领域的应用及未来研究方向。

Comments Extended version of the original ACM CSUR paper, 49 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏