arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

1302.3862 2013-02-18 cs.HC 71%

GEMINI: A Generic Multi-Modal Natural Interface Framework for Videogames

Luís Filipe Teófilo, Pedro Alves Nogueira, Pedro Brandão Silva

专题命中 音频语音多模态 :multi-modal(title)

Comments WorldCIST'13 Internacional Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
1209.4982 2012-09-25 cs.HC cs.GR 71%

Using multimodal speech production data to evaluate articulatory animation for audiovisual speech synthesis

Ingmar Steiner, Korin Richmond, Slim Ouni

专题命中 音频语音多模态 :multimodal(title)

Journal ref 3rd International Symposium on Facial Analysis and Animation (2012)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23758 2026-08-28 cs.SD cs.AI 版本更新 70%

EXAM$^2$: $\underline{Ex}tending$ $\underline{A}udio$ $Understanding$ $in$ $\underline{M}ultilingual$ $and$ $\underline{M}ultimodal$ $Analysis$

EXAM²:扩展多语言与多模态分析中的音频理解能力

Jiawen Wang, Xiaoxue Gao, Zi Haur Pang, Nancy F. Chen

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出多语言多模态音频理解基准EXAM²,评估现有模型发现其存在多语言跨模态理解差距,微调的Gemma3n-EXAM²性能显著提升,推动相关研究发展。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24674 2026-08-26 cs.CV 新提交 70%

TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation

TurboT2VA:基于分数正则化一致性蒸馏的快速大规模文本-视频-音频生成

Xiaoda Yang, Yuxiang Liu, Kaiwen Zheng, Yuan Liu, Yibo Lai, Shengpeng Ji, Kai Jiang, Jianfei Chen, Xiaobin Hu, Shuicheng Yan, Jintao Zhang, Jun Zhu, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tianjin University(天津大学) Tsinghua University(清华大学) Qingdao University(青岛大学) National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出TurboT2VA框架,通过多模态归一化与渐进式课程方案,在保持音视频生成质量的同时,大幅加速190亿参数联合T2VA模型的推理,在不同分辨率下实现最高54.67倍的生成器加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16681 2026-08-18 eess.AS cs.SD eess.SP 版本更新 70%

A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models

音频超分辨率和带宽扩展从判别模型到生成模型的综述

Ningyuan Yang, Yize Li, Diego A. Cuji, Ryan M. Corey, Pu Zhao, Xue Lin, Andrew C. Singer

机构 * Discovery Partners Institute(发现伙伴研究所)

专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 eess.AS

AI总结 本文综述了音频超分辨率和带宽扩展领域,从判别模型向生成模型的转变,总结了早期判别模型的局限性以及生成模型在表示域、架构、条件机制等方面的改进,探讨了大语言模型和多模态基础模型等新兴方向,并指出了感知评估、相位建模和实际应用泛化等开放挑战。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08366 2026-08-11 cs.CV q-bio.GN 新提交 70%

VOICE: A Vision-Omics Foundation Model Integrating Direct and Retrieval-Based Prediction of In-situ Single-Cell Gene Expression

VOICE:一种融合原位单细胞基因表达直接预测与基于检索预测的视觉-组学基础模型

Xin Luo, Yicheng Tao, Haoxuan Zeng, Suyuan Wang, Chenzi Ouyang, Meiqi Zhu, Kai Liu, Shuibing Chen, Jie Liu

机构 * University of Michigan(密歇根大学) Weill Cornell Medicine(威尔康奈尔医学院)

专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 该研究提出多模态基础模型 VOICE,通过对比学习对齐 H&E 形态与单细胞表达嵌入,融合直接回归与参考检索分支,泛化性良好且在七项指标上优于现有方法,可从 H&E 图像预测单细胞基因表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06930 2026-08-10 cs.CV 新提交 70%

AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward

AVCap:用细节感知奖励强化音视频联合字幕

Mingyang Wu, Kaituo Feng, Bohao Li, Kaixiong Gong, Zihao Yin, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Peking University(北京大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 针对音视频联合字幕的数据集、奖励信号、评估基准的局限,提出AVCap-100K数据集、AVCap模型及专用基准指标,通过Da-GRPO优化的AVCap模型性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06773 2026-08-10 cs.CV 新提交 70%

AnyTrack: Unifying Visual Object Tracking with Any Modalities

AnyTrack:用任意模态统一视觉目标跟踪

Hao Li, Yunzhi Zhuge, Wenning Hao, Pingping Zhang, Xiaoxiong Zhang, Dong Wang, Huchuan Lu

机构 * Army Engineering University of PLA(中国人民解放军陆军工程大学) Dalian University of Technology(大连理工大学) National University of Defense Technology(国防科技大学)

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对现有多模态目标跟踪器适配性与泛化性差的问题,提出AnyTrack框架,通过MIM与CUM模块实现任意模态的统一跟踪,扩展基准后实验验证其性能先进、灵活有效。

Comments Accepted by ACM MM2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04709 2026-08-06 cs.CL 新提交 70%

EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot

EmpaAva:开源智能体式3D化身共情实时聊天机器人

Jie Yang, Wenhao Xu, Shuhui Lin, Hao Fei

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Oxford(牛津大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL

AI总结 该研究提出首个开源智能体式3D化身共情聊天机器人EmpaAva,通过三智能体架构实现闭环多模态交互,在评估中优于多款基准模型,将开源并提供在线演示。

Comments Project&Demo: https://empaava.top/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04351 2026-08-06 cs.SD cs.AI 新提交 70%

HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models

HyPASE:用于大音频语言模型的参数高效语音情感微调框架的双曲几何方法

Tian Jin, Ruikang Zhang, Zefeng Zhao, Ding Luo, Jin Zeng

机构 * Tongji University(同济大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

专题命中 音频语音多模态 :cross-modal(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出HyPASE双曲PEFT框架,利用庞加莱球模型及HGA、EMCA组件,在MELD、IEMOCAP等数据集上优于欧氏PEFT基线,实现高效的大音频语言模型语音情感微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20918 2026-08-05 cs.AI 版本更新 70%

OPOD: On-Policy Omni Distillation

OPOD:基于策略的全模态蒸馏

Tong Zhao, Yuyang Hu, Yutao Zhu, Reed Li, Haijin Liang, Haibo Shi, Yu Lu, Zhicheng Dou

机构 * Tencent(腾讯)

专题命中 音频语音多模态 :multimodal(abstract);omni-modal(abstract);分类 cs.AI

AI总结 研究旨在提升全模态模型能力,提出基于策略的全模态蒸馏(OPOD)方法,将学生响应路由到对应模态教师,调整教师影响,训练后仅留可部署的全模态模型,在多基准测试和多种骨干网络规模下取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17773 2026-07-21 cs.MM 新提交 70%

FillGauss: Fine-Grained Filling-Aware Impact Sound Generation for 3D Gaussian Splatting

FillGauss:用于3D高斯点云的细粒度填充感知撞击声生成

Chen Yang, Ganye Wen, Bin Huang, Jiayi Lyu, Zehai Niu, Linlin Shen, Jinbao Wang

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.MM

AI总结 研究针对多模态AI中从视觉合成撞击声的挑战,提出细粒度填充感知撞击声生成任务。基于FillImpact数据集,构建FillGauss框架,融合多种要素实现位置、撞击物及填充感知音频生成,达物理基础跨模态音频生成新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13669 2026-07-16 cs.CV 新提交 70%

Learning Speaker Identity Beyond Language and Modality Constraints: Insights from the POLY-SIM 2026 Challenge

超越语言和模态限制学习说话者身份:来自POLY-SIM 2026挑战赛的见解

Marta Moscati, Muhammad Saad Saeed, Marina Zanoni, Mubashir Noman, Rohan Kumar Das, Monorama Swain, Yassin Terraf, Yufang Hou, Elisabeth Andre, Khalid Mahmood Malik, Markus Schedl, Shah Nawaz

机构 * Institute of Computational Perception, Johannes Kepler University(约翰内斯·开普勒大学计算感知研究所) University of Michigan-Flint(密歇根大学弗林特分校) BDO DIGITAL Gmbh(BDO数字有限公司) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Fortemedia(富特媒体公司) College of Computing, Mohammed VI Polytechnic University(穆罕默德六世理工大学计算学院) IT:U Interdisciplinary Transformation University(IT:U跨学科转型大学) University of Augsburg(奥格斯堡大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 POLY-SIM 2026挑战赛旨在解决多模态说话者识别中语言和模态限制问题,针对实际应用中信息缺失、多语言等挑战,为比较解决方案提供标准化设置。

Comments Accepted at ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11487 2026-07-14 cs.CL cs.AI cs.CV cs.HC cs.MM 新提交 70%

LightMem-Ego: Your AI Memory for Everyday Life

LightMem-Ego:适用于日常生活的人工智能记忆

Yijun Chen, Boyi Xiao, Yixian Zhao, Haoting Xia, Buqiang Xu, Jizhan Fang, Yanya Li, Yaqi Zheng, Xuehai Wang, Zirui Xue, Liuxin Zhang, Hui Li, Ningyu Zhang

机构 * Zhejiang University(浙江大学) South China University of Technology(华南理工大学) Central China Normal University(华中师范大学) Lenovo Group Limited(联想集团有限公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对移动和可穿戴设备上个人AI助手回答过去经历查询难的问题,提出LightMem-Ego轻量级流多模态记忆系统,能捕获、对齐并组织视觉和音频流成分层记忆,基于多模态证据生成答案,可部署在多种设备上提供多种支持。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03762 2026-06-26 eess.AS cs.LG 版本更新 70%

Conditional Flow Matching for Visually-Guided Acoustic Highlighting

基于条件流匹配的视觉引导声学增强

Hugo Malard, Gael Le Lan, Daniel Wong, David Lou Alon, Yi-Chiao Wu, Sanjeel Parekh

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院) Meta

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 eess.AS

AI总结 提出条件流匹配生成框架解决视觉引导音频重混中的多对多映射问题,通过滚动损失和跨模态融合模块实现优于判别方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22766 2026-06-23 cs.CV 新提交 70%

READ More than What You See: Reinforcement Learning for Accurate and Coherent Audio Description Generations

READ:超越所见——基于强化学习的准确连贯音频描述生成

Bo Fang, Xinyao Zhang, Yuxin Song, Hui Zhang, Hang Zhou, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学) Baidu Inc(百度公司) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出首个基于强化学习的音频描述生成框架READ,通过序列级优化和连贯性奖励,显著提升生成准确性与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17542 2026-06-17 cs.CL 新提交 70%

Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings

评估大型语言模型在会议中的收话人、话轮转换和下一说话人预测能力

Ryo Fukuda, Takatomo Kano, Siddhant Arora, Marc Delcroix, Naohiro Tawara, Atsunori Ogawa, Yuya Chiba, Atsushi Ando, William Chen, Shinji Watanabe

机构 * NTT, Inc., Japan(日本电信电话公司) Language Technologies Institute, Carnegie Mellon University, USA(卡内基梅隆大学语言技术研究所)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL

AI总结 利用大型语言模型(LLMs)研究多模态多人对话中的话轮转换,构建了收话人检测、话轮转换预测和下一说话人预测三个任务的评估框架,实验表明LLMs在下一说话人预测上优于监督模型和人类,但多模态LLM在收话人检测和话轮转换预测上仍低于人类水平。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28378 2026-06-17 cs.SD cs.AI 版本更新 70%

Membership Inference Attacks against Large Audio Language Models

针对大型音频语言的成员推断攻击

Jia-Kai Dong, Yu-Xiang Lin, Hung-Yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(国立成功大学人工智能卓越研究中心)

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 首次系统评估大型音频语言模型的成员推断攻击,提出盲基线协议控制分布偏移,发现跨模态记忆仅源于说话人声纹与文本绑定。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15848 2026-06-16 cs.CV 新提交 70%

EmoZone-Talker: Regional Semantic Control of Audio-Driven 3DGS Talking Heads via Facial Action Units

EmoZone-Talker: 基于面部动作单元的音频驱动3DGS说话人头部的区域语义控制

Tingting Chen, Shaojun Wang, Huaye Zhang, Diqiong Jiang, Chenglizhao Chen

机构 * China University of Petroleum (East China)(中国石油大学(华东))

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出EmoZone-Talker框架,通过区域解耦和时序建模解决音频与表情信号的冲突,实现精细、可解释的面部表情控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10887 2026-06-10 cs.CV 新提交 70%

Listen, Look, and Learn: Learning Without Forgetting through SAM-Audio

听、看、学:通过SAM-Audio实现无遗忘学习

Avi Gupta, Nilotpal Sinha, Vishnu Raj, Sambuddha Saha, Pratik Joshi, Koteswar Rao Jerripothula, Tammam Tillo

机构 * University of Washington(华盛顿大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出一种利用SAM-Audio多模态先验的类增量学习方法,通过引导注意力机制和双层蒸馏策略,在音频-视觉场景中缓解灾难性遗忘,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04205 2026-06-04 cs.MM cs.AI cs.CL cs.CV cs.LG cs.SD 70%

DetectZoo: A Unified Toolkit for AI-Generated Content Detection Across Text, Audio, and Image Modalities

DetectZoo:一个用于跨文本、音频和图像模态的AI生成内容检测的统一工具包

Sajad Ebrahimi, Nima Jamali, Bardia Shirsalimian, Kelly McConvey, Wentao Zhang, Jalehsadat Mahdavimoghaddam, Maksym Taranukhin, Maura Grossman, Vered Shwartz, Yuntian Deng, Ebrahim Bagheri

机构 * University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) Toronto Metropolitan University(多伦多 Metropolitan 大学) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出DetectZoo,一个首个统一的多模态AI生成内容检测工具包,通过标准化数据预处理、评估流程和集成61个检测器与22个基准数据集,实现公平可重复的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03540 2026-06-03 cs.CV 70%

Attend to Anything: Foundation Model for Unified Human Attention Modeling

关注一切:统一人类注意力建模的基础模型

Wenzhuo Zhao, Ronghao Xian, Keren Fu, Qijun Zhao

机构 * College of Computer Science, Sichuan University, Chengdu, 610065, China(四川大学计算机学院) National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University, Chengdu, 610065, China(合成视觉基础科学国家重点实验室)

专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出 Attend to Anything Model (AAM),一种多模态基础模型,通过层次化语言提示和双曲空间嵌入统一图像、视频和视听任务中的注意力建模,并在16个基准上平均提升6%,视频推理加速约4倍。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28714 2026-05-28 eess.AS 70%

VAANI: Capturing the language landscape for an inclusive digital India

VAANI:为包容性数字印度捕捉语言景观

Sujith Pulikodan, Abhayjeet Singh, Agneedh Basu, Nihar Desai, Pavan Kumar J, Pranav D Bhat, Raghu Dharmaraju, Ritika Gupta, Sathvik Udupa, Saurabh Kumar, Sumit Sharma, Visruth Sanka, Dinesh Tewari, Harsh Dhand, Amrita Kamat, Sukhwinder Singh, Shikhar Vashishth, Partha Talukdar, Raj Acharya, Prasanta Kumar Ghosh

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 本文提出大规模多模态数据集VAANI,覆盖印度165个地区、105种语言,通过图像提示收集自发语音并严格质控,旨在推动包容性语音技术发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23935 2026-04-28 cs.CV 70%

2nd of the 5th PVUW MeViS-Audio Track: ASR-SaSaSa2VA

第五届PVUW MeViS-Audio Track的第二名:ASR-SaSaSa2VA

Zhiyu Wang, Xudong Kang, Shutao Li

机构 * Hunan University(湖南大学)

专题命中 音频语音多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出ASR-SaSaSa2VA框架,通过ASR将音频转换为文本描述,结合预训练文本引导视频分割模型实现高效的音频引导视频分割,解决了计算复杂度高、对齐困难和数据依赖性强的问题。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11594 2026-04-27 eess.AS cs.SD 70%

HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models

HumDial-EIBench: 一个用于音频语言模型的情感智能基准测试

Shuiyuan Wang, Zhixian Zhao, Hongfei Xue, Chengyou Wang, Shuai Wang, Hui Bu, Xin Xu, Lei Xie

机构 * Nanjing University, China(南京大学,中国) AISHELL, China(AISHELL,中国)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 本文提出HumDial-EIBench,通过真实人类对话评估音频语言模型的情感智能,采用多选题和对抗性干扰项减少主观评分偏差,发现大多数模型在多轮情感跟踪和隐含因果推理上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16756 2026-04-21 cs.AI cs.CL cs.CV cs.RO eess.AS 70%

End-to-end Listen, Look, Speak and Act

端到端听、看、说和行动

Siyin Wang, Wenyi Yu, Xianzhao Chen, Xiaohai Tian, Jun Zhang, Lu Lu, Chao Zhang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出ELLSA模型,首个端到端全双工系统,实现视觉、文本、语音和行动的同步感知与生成,支持对话轮替、指令拒绝等复杂交互行为,推动更自然的人工智能发展。

Comments 22 pages, 8 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14122 2026-04-21 cs.CV 70%

EgoSound: Benchmarking Sound Understanding in Egocentric Videos

EgoSound:评估egocentric视频中声音理解的基准测试

Bingwen Zhu, Yuqian Fu, Qiaole Dong, Guolei Sun, Tianwen Qian, Yuzheng Wu, Danda Pani Paudel, Xiangyang Xue, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) East China Normal University(华东师范大学) KAUST(卡塔尔大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 EgoSound首次系统评估多模态大语言模型在egocentric视频中的声音理解能力,包含7个任务分类,揭示当前模型在空间和因果理解上的局限。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11154 2026-04-14 cs.AI 70%

Environmental Footprint of GenAI Research: Insights from the Moshi Foundation Model

生成式AI研究的环境足迹:来自Moshi基金会模型的洞察

Marta López-Rauhut, Loic Landrieu, Mathieu Aubry, Anne-Laure Ligozat

机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM, CNRS, 古斯塔夫·埃菲尔大学, ENPC, 巴黎综合理工学院) Université Paris-Saclay, CNRS, LISN(巴黎-萨克雷大学, CNRS, LISN) Université Paris-Saclay, CNRS, ENSIIE, LISN(巴黎-萨克雷大学, CNRS, ENSIIE, LISN) Kyutai

专题命中 音频语音多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文通过细粒度分析Moshi模型的计算消耗,首次量化了生成式多模态大语言模型(MLLM)研究的环境影响,揭示了计算密集型研究的能耗与环境成本,为可持续AI研究提供指导。

Comments 28 pages, 12 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09677 2026-04-09 cs.AI 70%

Logics-Parsing-Omni Technical Report

逻辑-解析-全能技术报告

Xin An, Jingyi Cai, Xiangyang Chen, Huayao Liu, Peiting Liu, Peng Wang, Bei Yang, Xiuwen Zhu, Yongfan Chen, Yan Gao, Yuan Gao, Baoyu Hou, Guangzheng Hu, Shuzhao Li, Weixu Qiao, Weidong Ren, Yanan Wang, Boyu Yang, Fan Yang, Jiangtao Zhang, Lixin Zhang, Lin Qu, Hu Wei, Xiaoxiao Xu, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.AI

AI总结 本文提出Omni Parsing框架,通过三级层次结构实现多模态解析,整合整体检测、细粒度识别和多级解释,构建证据锚定机制以提升逻辑推理能力,释放Logics-Parsing-Omni模型并发布评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00702 2026-04-01 cs.CV 70%

JoyStreamer: Unlocking Highly Expressive Avatars via Harmonized Text-Audio Conditioning

JoyStreamer: 通过和谐的文本-音频条件化解锁高度表达性的化身

Ruikui Wang, Jinheng Feng, Lang Tian, Huaishao Luo, Chaochao Li, Liangbo Zhou, Huan Zhang, Youzheng Wu, Xiaodong He

机构 * JD Technology(京东科技)

专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出JoyAvatar框架,通过双教师增强训练算法和动态调节多模态条件,提升视频化身生成的自然性和时序一致性,优于现有模型并在多人群对话等复杂应用中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏