arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-26 至 2026-08-26 共收录 86 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2608.23880 2026-08-26 cs.CV 新提交 90%

LG-GER: Language-Guided Group Emotion Recognition via Multimodal Evidence Distillation

LG-GER:基于多模态证据蒸馏的语言引导群体情绪识别

Ahmed Shehab Khan, Zhiyuan Li, Yan Tong

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(summary_cn,abstract);分类 cs.CV

AI总结 该研究提出LG-GER框架,通过MLLM生成结构化证据并蒸馏至VLM骨干,无需检测器等即可实现高效群体情绪识别,在GroupEmoW和GAF 3.0数据集上取得了有竞争力或更优的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24325 2026-08-26 cs.AI 新提交 85%

SonarLLM: A Native Sonar--Optical Multimodal Large Language Model for Underwater Perception

SonarLLM:一种用于水下感知的原生声呐-光学多模态大语言模型

Cong Su, longxuan ma, Ling Dong, Guofeng Tang, Weijie Yin, Haohui Chen, Zhengtao Yu

机构 * Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) Yunnan Key Laboratory of Artificial Intelligence(云南省人工智能重点实验室)

专题命中 图文多模态 :multimodal(title);MLLM(abstract,abstract_cn);cross-modal(abstract);分类 cs.AI

AI总结 针对现有多模态大语言模型不适用于水下声呐-光学感知的问题,提出SonarLLM模型,结合专用编码器与分层融合机制,在SonarBench基准上实现了优异的水下感知性能,凸显了声呐的互补价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23570 2026-08-26 cs.CL 新提交 83%

Taming Visual Neglect: A Variational Information Bottleneck Framework for Adaptive Attention in Multimodal In-Context Learning

驯服视觉忽视:用于多模态上下文学习中自适应注意力的变分信息瓶颈框架

Kaito Tanaka, Yuji Nishimura, Keisuke Matsuda, Aya Nakayama

机构 * SANNO University(山王大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 针对多模态上下文学习中视觉上下文时而被利用时而被忽视的问题,提出VIB-ICL框架,通过CMIG量化跨模态信息,推导理论界并经五组基准实验验证,实现准确率提升与演示样本减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21170 2026-08-26 cs.CV cs.AI 版本更新 62%

Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds

视觉提示就足够了?研究渐进式视觉支架下视觉语言模型的空间推理能力

Lars Benedikt Kaesberg, Tianyu Yang, Florian Valentin Wunderlich, Terry Ruas, Daniel Kurzawe, Jan Philip Wahle, Bela Gipp

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对 VLMs 的空间推理问题,在 SPaRC 基准中引入轻量视觉支架,可提升 VLMs 任务准确率并补充 GRPO 训练,揭示视觉呈现对 VLM 基准测量属性的关键作用。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-08-26 cs.CV cs.AI 版本更新 62%

EviPathBench: Benchmarking Evidence Acquisition and Reasoning in Vision-Language Models for Whole-Slide Pathology

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24640 2026-08-26 cs.MM 新提交 57%

EVEREST:Endogenous Vision-Language Reinforcement Reasoning Exploration for Urban Socio-Semantic Segmentation

EVEREST:面向城市社会语义分割的内生视觉语言强化推理探索

Qixiu Li, Zhongzhi He, Xiang Zhu, Xiaoyong Li, Jiarun Lin, Weifeng Xu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.MM

AI总结 针对城市社会语义分割中目标边界划分不准确的问题,提出EVEREST模型,通过以自我为中心的探索策略、伪代码规范执行逻辑及强化学习,在真实数据集上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 10 篇

2608.24209 2026-08-26 cs.MM 新提交 89%

Task-disentangled Low-Rank Adaptation for Versatile Audio-visual Multi-modal Learning Tasks within a Unified Framework

面向统一框架内多模态视听学习任务的任务解耦低秩适配方法

Hanyu Xuan, Mengqi Zhang, Junjun Mao, Fei Wang, Kun Li, Guanghui Yue, Zhiliang Wu, Hehe Fan

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出统一框架下的任务解耦低秩适配(LoRA)机制,解决多视听任务联合训练的干扰问题,在多项视听任务上优于现有统一模型及部分任务特定模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23759 2026-08-26 eess.AS cs.SD 新提交 80%

The ISCSLP 2026 Real-World Audio-Visual Speech Enhancement Challenge

ISCSLP 2026 真实场景视听语音增强挑战赛

Challenge Organizers

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 该研究介绍ISCSLP 2026真实场景视听语音增强挑战赛,设置含真实混合、合成重混等赛道,公布基线结果与相关资源,以评估视听语音增强在自然场景下的性能。

Comments The First Real-World Audio-Visual Speech Enhancement (AVSE) Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24160 2026-08-26 cs.AI 新提交 79%

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

全能评判者还是全能偏差?通过平衡、解耦的视角诊断多模态评判者

Guangzheng Hu, Ziyue Jiang, Weixu Qiao, Lixin Zhang, Jianye Kang, Yuru Wu, Rong Bao, Niantong Li, Wei Wang, Ziyi Cheng, Xinfa Zhu, HangRui Hu, Ting He, Bing Zhao, Lin Qu, Hu Wei, Jin Xu

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究推出平衡解耦的多模态评判者诊断基准D3-Omni,发现全能评判者存在模态相关维度表现差、漏检失败等系统性盲点,为评估多模态模型提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23383 2026-08-26 cs.CV 版本更新 79%

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

面向持续故事与交互世界的长时序视听生成

Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 研究针对长时序视听生成的需求,提出JoyAI-Echo-1.5系统,含长视频与世界模型变体,通过专用技术实现跨镜头一致性等性能,在相关基准上取得领先结果,为生成连贯内容提供基础。

Comments Project page: this https URL (https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24674 2026-08-26 cs.CV 新提交 70%

TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation

TurboT2VA:基于分数正则化一致性蒸馏的快速大规模文本-视频-音频生成

Xiaoda Yang, Yuxiang Liu, Kaiwen Zheng, Yuan Liu, Yibo Lai, Shengpeng Ji, Kai Jiang, Jianfei Chen, Xiaobin Hu, Shuicheng Yan, Jintao Zhang, Jun Zhu, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tianjin University(天津大学) Tsinghua University(清华大学) Qingdao University(青岛大学) National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出TurboT2VA框架,通过多模态归一化与渐进式课程方案,在保持音视频生成质量的同时,大幅加速190亿参数联合T2VA模型的推理,在不同分辨率下实现最高54.67倍的生成器加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23758 2026-08-26 cs.SD cs.AI 新提交 70%

EXAM$^2$: $\underline{Ex}tending$ $\underline{A}udio$ $Understanding$ $in$ $\underline{M}ultilingual$ $and$ $\underline{M}ultimodal$ $Analysis$

EXAM²:扩展多语言与多模态分析中的音频理解能力

Jiawen Wang, Xiaoxue Gao, Zi Haur Pang, Nancy F. Chen

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出多语言多模态音频理解基准EXAM²,评估现有模型发现其存在多语言跨模态理解差距,微调的Gemma3n-EXAM²性能显著提升,推动相关研究发展。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06165 2026-08-26 cs.SD cs.AI cs.MM 版本更新 62%

Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

基于预训练特征、数据增强及新SheetSage-A2S数据集的音频转乐谱转录

Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo, Yaolong Ju

机构 * University College Dublin(都柏林大学学院) Guangxi Normal University(广西师范大学) Great Bay University(大湾区大学) Shenzhen University(深圳大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 该研究针对流行音乐音频转乐谱研究不足的问题,构建了SheetSage-A2S数据集,结合预训练模型MuQ与数据增强改进A2S方法,在古典与流行音乐基准上均取得优于现有技术的性能。

Comments Accepted at the 34th ACM International Conference on Multimedia (MM '26) 2026-08-25: Edit to drop TeX commands in abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14249 2026-08-26 cs.SD cs.AI eess.AS 版本更新 62%

Do Joint Language-Audio Embeddings Encode Perceptual Timbre Semantics?

联合语言-音频嵌入是否编码感知音色语义?

Qixin Deng, Bryan Pardo, Thrasyvoulos N Pappas

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Computer Science(计算机科学系) Northwestern University(西北大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文评估MS-CLAP等联合语言-音频嵌入模型捕捉感知音色语义的能力,发现LAION-CLAP对齐表现较强但整体有限,混响诱导音色语义的编码一致性优于均衡诱导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24579 2026-08-26 eess.AS 新提交 57%

Visually-Guided Spatial Audio Generation for $360^\circ$ In-the-Wild Speech Scenes

面向野外360°语音场景的视觉引导空间音频生成

Qingyu Luo, Peng Zhang, Wenwu Wang, Philip J. B. Jackson

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 针对野外360°语音场景空间音频采集质量受限问题,本文提出视觉引导的FOA语音空间化方法,构建YT-SPEECH数据集,采用Localizer-Renderer框架实现定向FOA信号重建,提升了音频相关性能。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24707 2026-08-26 cs.CL 新提交 57%

Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts

迷失在语音中:跨音频与文本的三语语音幻觉检测

Meruyert Aristombayeva, Jason S. Lucas, Chaewan Chun, Dongwon Lee

机构 * Satbayev University(萨塔巴耶夫大学) University of Colorado Boulder(科罗拉多大学博尔德分校) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 该研究针对低资源语言语音幻觉检测的空白,构建三语语音幻觉基准,评估多模态检测模型,发现文本检测更优,合成训练检测器在真实数据上迁移性强,还揭示合成基准的混淆因素。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 11 篇

2608.24845 2026-08-26 cs.CV cs.AI cs.LG 新提交 84%

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

LAION-BVD:用于多模态预训练的千万小时级开源视频数据集

Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti, Andrej Radonjic, Thaddäus Wiedemer, Christoph Schuhmann, Romain Beaumont, Wieland Brendel, Bernhard Schölkopf, A. Sophia Koepke, Jenia Jitsev, Matthias Bethge

专题命中 视频多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 研究团队构建了千万小时级开源多模态视频数据集LAION-BVD,经其训练的模型在视频-文本、音频-文本及图像-文本基准上表现出色,为多模态预训练提供了大规模数据支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24340 2026-08-26 cs.CV cs.AI cs.HC cs.LG 新提交 66%

Mind the Student: Behavioral and Contextual Cues for Automated Engagement Prediction in Online Learning

关注学生:在线学习中自动参与度预测的行为与上下文线索

Alperen Kantarci, Visvanathan Ramesh, Gemma Roig

机构 * Goethe University Frankfurt(法兰克福大学) The Hessian Center for Artificial Intelligence(黑森人工智能中心)

专题命中 视频多模态 :multimodal(abstract,comments);分类 cs.CV、cs.AI

AI总结 本研究针对在线学习中自动参与度预测的多维构念与标注主观性等挑战,提出整合多模态特征与不确定性感知预测的Perceiver IO框架,在CASED数据集上取得具竞争力性能且提供校准良好的不确定性指标。

Comments Accepted to ICMI 2026 (International Conference on Multimodal Interaction), October 5-9, 2026, Napoli, Italy. 5 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24063 2026-08-26 cs.CV cs.AI 新提交 62%

VisCache: Visual KV Cache Pruning for Efficient Vision Large Language Model Inference

VisCache:用于高效视觉大语言模型推理的视觉键值缓存剪枝方法

Lyuke Wang, Zhuo Li, Guangxu Zhu

机构 * Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VisCache是一种无需训练的即插即用视觉KV缓存剪枝框架,通过两阶段协同操作提升VLLM长上下文推理效率,实现最高2.35倍加速,建立效率与性能的新帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23329 2026-08-26 cs.CV cs.AI 版本更新 62%

Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents

超越视频:统一视频推理与深度研究的开放世界视频智能体

Wenqi Liu, Shijie Ma, Yunxiao Wang, Meng Liu, Qile Su, Han Liu, Bohan Hou, Zeyu Wang, Xuanyu Zheng, Changyi Liu, Tianke Zhang, Haonan Fan, Kaiyu Jiang, Yingxin Li, Jiankang Chen, Xu Wang, Hongyi Fu, Jianxiong Wang, Bin Wen, Tingting Gao, Han Li, Jianhua Yin, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) Nanyang Technological University(南洋理工大学) Kuaishou Technology(快手科技) Southern University of Science and Technology(南方科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出统一视频推理与深度研究的VideoRover框架,构建相关数据集与基准,其8B-RL模型在无工具直接回答场景性能接近专有模型,优于同工具套件的更大开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07737 2026-08-26 cs.CV cs.AI 版本更新 62%

Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes

看见 vs. 相信:评估开源多模态大模型在反直觉场景中的语言偏见

Chen Ling, Tongwei Zhang, Hanqian Li, Nai Ding

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 为评估多模态大模型处理反直觉动作场景的能力,提出CAIT基准(400个高保真合成场景),发现开源模型因语言先验而忽视视觉证据,性能接近随机水平,而链式思维推理虽提升准确率但导致过度思考拒绝视觉内容,通过微调和结构化提示可缓解此偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24763 2026-08-26 cs.CV cs.LG 新提交 57%

MoTE: Mixture of Task Experts for Multi-Task Video Understanding

MoTE:面向多任务视频理解的任务专家混合模型

Muhammad Asad Ali, Umar Khan, Nadia Robertini, Didier Stricker

机构 * University of Kaiserslautern-Landau (RPTU)(凯泽斯劳滕-兰道大学(RPTU)) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对多任务视频理解中现有解码器的任务行为纠缠、能力扩展难等问题,提出MoTE架构,实例化为VideoLLM-MoTE,在COIN基准上表现优于基线,实现了可解释且计算高效的多任务视频-语言学习。

Comments Accepted at BMVC 2026. 32 pages, 4 figures, 15 tables, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24680 2026-08-26 cs.CV 新提交 57%

Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training

Game2World引擎:解锁野外游戏视频用于世界模型训练

Wenxuan Shen, Dongna Jin, Dongping Chen

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对游戏视频界面干扰世界模型训练的问题,提出GameUI-Taxonomy与G2WEngine框架构建Game2World数据集,研发无掩码UI去除模型GameCleaner,提升了世界模型训练效果与UI去除性能。

Comments We are currently building Gaming World Model and data engine that transfers game dynamics to robotics. Feel free to contact Dongping Chen (dongpingchen0612@gmail.com) if you are interested in research collaboration or financial support

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24574 2026-08-26 cs.AI 新提交 57%

PhysMLLMs: Spatial Priors for Unified Referring Segmentation and Grounded Reasoning of Images and Videos

PhysMLLMs:用于图像与视频的统一指称分割及接地推理的空间先验

Siyao Yan, Bo Han, Jisheng Dang, Bimei Wang, Shude Wang, Hong Peng, Yulan Guo, Jianhuang Lai, Bin Hu, Tat-SengChua

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) School of Electronics and Communication Engineering, Sun Yat-sen University(中山大学电子与通信工程学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 PhysMLLMs是注入物理启发空间先验的训练架构,通过REPA-Global机制提升视频分割的时空一致性,且不损害图像级接地与通用多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23397 2026-08-26 cs.AI 版本更新 57%

MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction

MediSkill-Evo:面向证据依据的临床交互的过程约束自进化

Ruoyu Wu, Shenfu Xie, Yinqian Sun, Haibo Tong, Feifei Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 MediSkill-Evo是无需主干微调的临床智能体,通过四类经验存储库与过程约束偏好工具优化,在多维度评估中提升了诊断准确率等指标,验证了其临床交互性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21467 2026-08-26 stat.ML cs.IT cs.LG 版本更新 50%

Gauss--Hermite Quadrature for Gaussian-Mixture Entropy with an Action-Space Hermite Surrogate

用于高斯混合熵的高斯-埃尔米特求积法及动作空间埃尔米特代理模型

Jae Wan Shim

专题命中 视频多模态 :multimodal(abstract)

AI总结 该研究提出用于计算高斯混合微分熵的高斯-埃尔米特求积法,还提出动作空间埃尔米特多项式代理模型,在雷达指向基准中其性能优于二阶泰勒代理模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06783 2026-08-26 cs.SE cs.HC 版本更新 50%

Modeling Software Quality in Virtual Reality Applications from User Feedback

基于用户反馈的虚拟现实应用软件质量建模

Shuqing Li, Chenran Zhang, Yepang Liu, Cuiyun Gao, Shing-Chi Cheung, Michael R. Lyu

专题命中 视频多模态 :multimodal(abstract)

AI总结 该研究通过分析7个应用商店28745款VR应用的165万余条公开评论,构建了含12个质量属性和10个影响因素的VR软件质量层次模型,为VR质量保证提供了优先级并发布了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 10 篇

2608.23646 2026-08-26 cs.AI cs.LG 新提交 84%

MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models

MolEmb:多模态大语言模型可作为强大的分子嵌入模型

Xinjian Zhao, Xiangru Jian, Yaoyao Xu, Xiaozhuang Song, Wei Pang, Lei Bai, Tianshu Yu

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI;multi-modal(comments)

AI总结 本文提出MolEmb框架,利用多模态大语言模型构建通用分子嵌入模型,在分子性质预测上具竞争力,还提出MolCAR基准验证上下文感知分子嵌入的特性。

Comments Presented at the 3rd Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences (FM4LS), ICML 2026. Non-archival workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24053 2026-08-26 cs.CV cs.CL cs.IR 新提交 81%

WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

WeMM-Embedding:微信多模态嵌入技术报告

Junjie Zhou, Ke Mei, Lei Li, Tianyi Wang, Fengyun Rao, Jing Lyu

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部)

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本报告提出WeMM-Embedding多模态嵌入模型家族,含2B、4B、9B变体,经两阶段训练后在公开基准及微信应用中表现优异,已部署并开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23920 2026-08-26 cs.IR cs.CL cs.CV 新提交 81%

Wontopos Tablet 2: Measuring Multilingual and Multimodal Memory Retrieval Without Lexical Matching

Wontopos Tablet 2:无需词汇匹配的多语言多模态记忆检索测量

Sunwoo Kim

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文测量Wontopos Tablet 2的多语言多模态记忆检索性能,其无需词汇匹配,在文本、跨语言及多模态基准上表现优于BM25等方法,但存在低资源语言性能下降等问题。

Comments 42 pages, 8 figures. Harness and per-question records released

详情

展开后加载摘要…

URL PDF HTML 收藏