arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-09 至 2025-12-09 共收录 102 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 14 篇

2304.02278 2025-12-09 cs.CV 83%

SCMM: Calibrating Cross-modal Representations for Text-Based Person Search

SCMM:基于文本的人脸搜索的跨模态表示校准

Jing Liu, Donglai Wei, Yang Liu, Sipeng Zhang, Tong Yang, Wei Zhou, Weiping Ding, Victor C. M. Leung

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) Department of Electrical and Computer Engineering, The University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) MEGVII Technology(MEGVII技术) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) School of AI and CS, Nantong University(南通大学人工智能与计算机科学学院) Academy of Artificial Intelligence, SMBU(SMBU人工智能学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)

专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 SCMM通过缝校准和掩码建模方法,提升跨模态表示学习在文本驱动的人脸搜索中的性能。

Comments 11 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06811 2025-12-09 cs.CV cs.AI cs.LG cs.MM 82%

RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models

RMAdapter: 基于重建的多模态适配器用于视觉-语言模型

Xiang Lin, Weixin Li, Shu Guo, Lihong Wang, Di Huang

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 RMAdapter通过双分支架构平衡通用与任务特定知识,提升视觉-语言模型在多模态迁移学习中的性能。

Comments Accepted by AAAI 2026(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07203 2025-12-09 cs.CV 79%

MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning

MMRPT:通过遮蔽视觉依赖推理的多模态强化预训练

Xuhui Zheng, Kang An, Ziliang Wang, Yuhang Wang, Faqiang Qian, Yichao Wu

机构 * SenseTime(秒速科技)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 MMRPT通过强化学习提升多模态预训练效果,利用视觉基础推理增强模型对视觉内容的理解能力。

Comments 7 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13036 2025-12-09 cs.CV 70%

uCLIP: Parameter-Efficient Multilingual Extension of Vision-Language Models with Unpaired Data

uCLIP: 无配对数据下多语言视觉语言模型的参数高效扩展

Dahyun Chung, Donghyun Shin, Yujin Sung, Seunggi Moon, Jinwoo Jeon, Byung-Jun Lee

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 uCLIP通过无需配对数据的轻量级框架,在低资源语言中实现高效多语言视觉语言对齐。

Comments Our project page can be found at https://dinyudin203.github.io/uCLIP-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09620 2025-12-09 cs.CV cs.AI cs.CL 67%

Exploring the Potential of Encoder-free Architectures in 3D LMMs

探索无编码器架构在3D大语言模型中的潜力

Yiwen Tang, Zoey Guo, Zhuhao Wang, Ray Zhang, Qizhi Chen, Junli Liu, Delin Qu, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Tele AI

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出首个无编码器3D大语言模型ENEL,通过嵌入语义编码和分层几何聚合策略,在3D理解任务中达到与SOTA模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07360 2025-12-09 cs.CV cs.AI 62%

Structure-Aware Feature Rectification with Region Adjacency Graphs for Training-Free Open-Vocabulary Semantic Segmentation

基于区域邻接图的结构感知特征校正用于无训练开放词汇语义分割

Qiming Huang, Hao Ai, Jianbo Jiao

机构 * The MIx Group, School of Computer Science University of Birmingham(米克集团,计算机科学学院,伯明翰大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于区域邻接图的结构感知特征校正方法,通过增强局部辨别能力来提升开放词汇语义分割的性能。

Comments Accepted to WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04002 2025-12-09 cs.CL 57%

AgriGPT-VL: Agricultural Vision-Language Understanding Suite

AgriGPT-VL:农业视觉-语言理解套件

Bo Yang, Yunkui Chen, Lanfei Feng, Yu Zhang, Xiao Xu, Jianyu Zhang, Nueraili Aierken, Runhe Huang, Hongjian Lin, Yibin Ying, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 AgriGPT-VL通过构建农业专用的视觉-语言模型和评估套件,提升了农业领域的多模态理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20549 2025-12-09 cs.LG cs.AI 57%

MedGR$^2$: Breaking the Data Barrier for Medical Reasoning via Generative Reward Learning

MedGR$^2$: 通过生成奖励学习突破医学推理的数据壁垒

Weihai Zhi, Jiayan Guo, Shangyang Li

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

AI总结 MedGR$^2$通过生成奖励学习解决医学推理中的数据稀缺问题,实现高效训练和泛化,优于现有方法。

Comments 8 pages, 5 figures

Journal ref AAAI'2026 Main Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04650 2025-12-09 cs.CV 57%

EncQA: Benchmarking Vision-Language Models on Visual Encodings for Charts

EncQA:在图表视觉编码上评估视觉-语言模型的基准测试

Kushin Mukherjee, Donghao Ren, Dominik Moritz, Yannick Assogba

机构 * Stanford University(斯坦福大学) Apple(苹果公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 EncQA通过系统覆盖图表理解的关键视觉编码和任务,揭示了不同编码和任务间VLMs性能的显著差异,强调了针对性策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06835 2025-12-09 cs.AI 57%

Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning

解耦以泛化:面向数据稀缺的视觉语言推理的上下文优先自进化学习

Tingyu Li, Zheng Sun, Jingxuan Wei, Siyuan Li, Conghui He, Lijun Wu, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai JiaoTong University(上海交通大学) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 DoGe通过双解耦框架,引导模型优先从上下文学习以提升数据稀缺下的视觉语言推理能力,提出两阶段RL方法和演进课程学习流水线,有效解决传统方法的奖励黑客问题。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06750 2025-12-09 cs.CV 57%

UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement

UARE:面向图像质量评估、修复和增强的统一视觉-语言模型

Weiqi Li, Xuanyu Zhang, Bin Chen, Jingfen Xie, Yan Wang, Kexin Zhang, Junlin Li, Li Zhang, Jian Zhang, Shijie Zhao

机构 * School of Electronic and Computer Engineering, Peking University, 2 ByteDance Inc(1 电子与计算机工程学院,北京大学,2 字节跳动公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 UARE是首个统一视觉-语言模型,通过统一训练框架提升图像质量评估、修复和增强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06328 2025-12-09 cs.CV 57%

ReCAD: Reinforcement Learning Enhanced Parametric CAD Model Generation with Vision-Language Models

ReCAD: 基于强化学习的参数化CAD模型生成增强框架

Jiahao Li, Yusheng Luo, Yunzhong Lou, Xiangdong Zhou

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 ReCAD通过强化学习增强参数化CAD模型生成,利用预训练模型生成高精度CAD模型,显著提升几何精度和语义保真度。

Comments Accepted as an Oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06096 2025-12-09 cs.CV 57%

BeLLA: End-to-End Birds Eye View Large Language Assistant for Autonomous Driving

BeLLA:端到端的鸟瞰图大语言助手用于自动驾驶

Karthik Mohan, Sonam Singh, Amit Arvind Kale

机构 * UC San Diego(加州大学圣地亚哥分校) Robert Bosch Corporate Research India(博世印度公司研究)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 BeLLA通过端到端架构连接统一的360°鸟瞰图表示与大语言模型,提升自动驾驶中的空间推理和问答能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16412 2025-12-09 cs.CV cs.CE 57%

A Survey on Industrial Anomalies Synthesis

工业异常合成方法综述

Yanshu Wang, Xichen Xu, Jiaqi Liu, Xiaoning Lei, Guoyang Xie, Guannan Jiang, Zhichao Lu

机构 * Shanghai Jiao Tong University(上海交通大学) City University of Hong Kong(香港城市大学) Department of Intelligent Manufacturing, CATL(CATL智能制造部门)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出工业异常合成方法的统一综述,引入首个分类法并探讨多模态学习的应用,为未来研究提供框架和路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 6 篇

2503.21699 2025-12-09 cs.MM cs.AI cs.CV cs.SD eess.AS 88%

MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX

MAVERIX:多模态音频视觉评估与识别指数

Liuyue Xie, Avik Kuthiala, George Z. Wei, Ce Zheng, Ananya Bal, Mosam Dabhi, Liting Wen, Taru Rustagi, Ethan Lai, Sushil Khyalia, Rohan Choudhury, Morteza Ziyadi, Xu Zhang, Hao Yang, László A. Jeni

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.CV、cs.AI、cs.MM

AI总结 MAVERIX是一个用于评估多模态模型音频视觉整合能力的统一基准,通过精心设计的问题展示模型在跨模态理解上的性能,揭示了与人类水平的显著差距。

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06689 2025-12-09 cs.CV eess.AS 81%

Lightweight Wasserstein Audio-Visual Model for Unified Speech Enhancement and Separation

轻量级瓦瑟斯坦音频视觉模型用于统一的语音增强与分离

Jisoo Park, Seonghak Lee, Guisik Kim, Taewoo Kim, Junseok Kwon

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

AI总结 UniVoiceLite通过轻量级无监督音频-视觉框架,统一语音增强与分离,利用嘴唇运动和面部身份线索,并采用瓦瑟斯坦距离正则化提升鲁棒性。

Comments Accepted to ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06485 2025-12-09 cs.CV 79%

Sanvaad: A Multimodal Accessibility Framework for ISL Recognition and Voice-Based Interaction

Sanvaad: 一种多模态可访问性框架,用于手语识别和基于语音的交互

Kush Revankar, Shreyas Deshpande, Araham Sayeed, Ansh Tandale, Sarika Bobde

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Sanvaad是一种多模态可访问性框架,通过结合轻量级计算机视觉和语音处理工具,为聋人和视障用户提供实时双向沟通解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06259 2025-12-09 cs.SD cs.AI cs.LG 79%

Who Will Top the Charts? Multimodal Music Popularity Prediction via Adaptive Fusion of Modality Experts and Temporal Engagement Modeling

谁会登顶排行榜?通过适应性融合模态专家和时间参与建模的多模态音乐流行度预测

Yash Choudhary, Preeti Rao, Pushpak Bhattacharyya

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 GAMENet通过融合多模态数据和时间参与建模,提升了音乐流行度预测的准确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06106 2025-12-09 cs.HC cs.AI 74%

Future You: Designing and Evaluating Multimodal AI-generated Digital Twins for Strengthening Future Self-Continuity

未来你:设计和评估多模态AI生成的数字双胞胎以加强未来自我连续性

Constanze Albrecht, Chayapatr Archiwaranguprok, Rachel Poonsiriwong, Awu Chen, Peggy Yin, Monchai Lertsutthiwong, Kavin Winson, Hal Hershfield, Pattie Maes, Pat Pataranutaporn

机构 * MIT Media Lab(MIT媒体实验室) Harvard University(哈佛大学) Stanford University(斯坦福大学) KASIKORN Labs(KASIKORN实验室)

专题命中 音频语音多模态 :multimodal(title);分类 cs.AI

AI总结 本研究通过多模态AI生成的未来自我探索其对自我连续性、情绪和动机的影响,发现avatar效果最佳,但各模态无显著差异,互动质量是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05397 2025-12-09 cs.HC cs.AI 57%

Simulating Life Paths with Digital Twins: AI-Generated Future Selves Influence Decision-Making and Expand Human Choice

用数字双胞胎模拟人生路径:AI生成的未来自我影响决策并拓展人类选择

Rachel Poonsiriwong, Chayapatr Archiwaranguprok, Constanze Albrecht, Peggy Yin, Nattavudh Powdthavee, Hal Hershfield, Monchai Lertsutthiwong, Kavin Winson, Pat Pataranutaporn

机构 * MIT Media Lab(MIT媒体实验室) Stanford University(斯坦福大学) Nanyang Technological University(南洋理工大学) University of California, Los Angeles(加州大学洛杉矶分校) KASIKORN Labs(KASIKORN实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究利用AI生成的未来自我虚拟形象,通过模拟人生路径拓展人类选择,发现平衡呈现和新增选项能有效影响决策,提升自主性认知。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 11 篇

2512.06334 2025-12-09 cs.IR 88%

Enhanced Multimodal Video Retrieval System: Integrating Query Expansion and Cross-modal Temporal Event Retrieval

增强多模态视频检索系统:整合查询扩展与跨模态时间事件检索

Van-Thinh Vo, Minh-Khoi Nguyen, Minh-Huy Tran, Anh-Quan Nguyen-Tran, Duy-Tan Nguyen, Khanh-Loi Nguyen, Anh-Minh Phan

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(title,abstract)

AI总结 本文提出了一种增强多模态视频检索系统,通过整合查询扩展和跨模态时间事件检索,提升检索精度和效率。

Comments 11 pages, 6 figures, SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06190 2025-12-09 cs.CV cs.AI cs.LG eess.IV 81%

Multi-Modal Zero-Shot Prediction of Color Trajectories in Food Drying

多模态零样本预测食品干燥中的颜色轨迹

Shichen Li, Ahmadreza Eslaminia, Chenhui Shao

机构 * Department of Mechanical Science and Engineering, University of Illinois at Urbana-Champaign, Urbana, IL, USA(机械科学与工程系,伊利诺伊大学厄巴纳-香槟分校) Department of Mechanical Engineering, University of Michigan, Ann Arbor, MI, USA(机械工程系,密歇根大学安娜堡分校)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态零样本方法,通过整合高维时间颜色信息和干燥参数,实现对食品干燥中颜色轨迹的高效预测,显著提升预测精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23478 2025-12-09 cs.CV 79%

Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models

Video-R2: 通过强化一致性和基于现实的推理提升多模态语言模型

Muhammad Maaz, Hanoona Rasheed, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Linköping University(林肯皮大学) Australian National University(澳大利亚国立大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Video-R2通过强化学习提升多模态模型在视频推理中的时间对齐和逻辑一致性,提高准确性和可信度。

Comments Video-R2 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06708 2025-12-09 cs.LG cs.AI 79%

A Novel Multimodal RUL Framework for Remaining Useful Life Estimation with Layer-wise Explanations

一种新型多模态剩余寿命估计框架,结合层间解释

Waleed Razzaq, Yun-Bo Zhao

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种结合图像和时频表示的多模态RUL估计框架,通过多头注意力和多模态LRP提升模型透明度,实验证明其在不同操作条件下均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06810 2025-12-09 cs.CV cs.CL 79%

MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning

MMDuet2:通过多轮强化学习增强视频MLLMs的主动交互

Yueqian Wang, Songxiang Liu, Disong Wang, Nuo Xu, Guanglu Wan, Huishuai Zhang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 MMDuet2通过多轮强化学习方法,实现了视频MLLMs在多轮对话中的主动交互,提升了回复时机和质量,达到ProactiveVideoQA基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01821 2025-12-09 cs.CV 70%

Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling

通过想象看见:通过隐式空间世界建模学习场景几何

Meng Cao, Haokun Lin, Haoyuan Li, Haoran Tang, Rongtao Xu, Dong An, Xue Liu, Ian Reid, Xiaodan Liang

机构 * MBZUAI SYSU(南方科技大学) PKU(北京大学) Spatialtemporal AI(时空人工智能)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出MILO和RePE,通过隐式空间世界建模提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06963 2025-12-09 cs.RO cs.AI cs.CV 62%

VideoVLA: Video Generators Can Be Generalizable Robot Manipulators

VideoVLA: 视频生成器可以成为通用的机器人操作器

Yichao Shen, Fangyun Wei, Zhiying Du, Yaobo Liang, Yan Lu, Jiaolong Yang, Nanning Zheng, Baining Guo

机构 * IAIR, Xi’an Jiaotong University(人工智能研究院、西安交通大学) Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 VideoVLA通过将视频生成模型转化为机器人VLA操作器,实现了动作与视觉后果的双预测,提升机器人操作的泛化能力。

Comments Project page: https://videovla-nips2025.github.io

Journal ref The Thirty-ninth Annual Conference on Neural Information Processing Systems(NeurIPS2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06032 2025-12-09 cs.CV cs.AI 62%

The SAM2-to-SAM3 Gap in the Segment Anything Model Family: Why Prompt-Based Expertise Fails in Concept-Driven Image Segmentation

在Segment Anything模型家族中SAM2到SAM3之间的鸿沟:基于提示的专家知识为何在概念驱动的图像分割中失效

Ranjan Sapkota, Konstantinos I. Roumeliotis, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(希腊皮洛斯大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文分析了SAM2到SAM3在分割模型中的断层,指出基于提示的分割方法在概念驱动分割中失效的原因,并探讨了SAM3的多模态架构与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05524 2025-12-09 cs.CV 57%

VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation

VOST-SGG:基于视觉语言模型的一阶段时空场景图生成

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(科学、技术与研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(科学、技术与研究局前沿人工智能研究中心)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 VOST-SGG通过整合视觉语言模型的常识推理能力,提出了一种基于多模态特征和双源查询初始化的一阶段时空场景图生成方法,实现了对视频中对象及其关系的高效建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14861 2025-12-09 cs.AI 57%

LabOS: The AI-XR Co-Scientist That Sees and Works With Humans

LabOS:能够看见并与人类协作的AI-XR共科学家

Le Cong, David Smerkous, Xiaotong Wang, Di Yin, Zaixi Zhang, Ruofan Jin, Yinkai Wang, Michal Gerasimiuk, Ravi K. Dinesh, Alex Smerkous, Lihan Shi, Joy Zheng, Ian Lam, Xuekun Wu, Shilong Liu, Peishan Li, Yi Zhu, Ning Zhao, Meenal Parakh, Simran Serrao, Imran A. Mohammad, Chao-Yeh Chen, Xiufeng Xie, Tiffany Chen, David Weinstein, Greg Barbone, Belgin Caglar, John B. Sunwoo, Fuxin Li, Jia Deng, Joseph C. Wu, Sanfeng Wu, Mengdi Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 LabOS是一种通过多模态感知和增强现实实现人机协作的AI系统,能实时协助科学家进行实验,推动实验室向智能协作环境发展。

详情

展开后加载摘要…

URL PDF HTML 收藏