arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-21 至 2026-01-21 共收录 151 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 10 篇

2601.12330 2026-01-21 cs.LG cs.AI 79%

IceWatch: Forecasting Glacial Lake Outburst Floods (GLOFs) using Multimodal Deep Learning

IceWatch: 使用多模态深度学习预测冰湖溃决洪水(GLOFs)

Zuha Fatima, Muhammad Anser Sohaib, Muhammad Talha, Ayesha Kanwal, Sidra Sultana, Nazia Perwaiz

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 IceWatch通过多模态深度学习结合空间和时间视角,实现对冰湖溃决洪水的高效预测,提升预警系统的可靠性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11990 2026-01-21 cs.CV 79%

DAOS: A Multimodal In-cabin Behavior Monitoring with Driver Action-Object Synergy Dataset

DAOS: 一种基于驾驶员行为与物体协同的多模态舱内行为监测数据集

Yiming Li, Chen Cai, Tianyi Liu, Dan Lin, Wenqian Wang, Wenfei Liang, Bingbing Li, Kim-Hui Yap

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) College of Computer Science and Technology, Harbin Engineering University(哈尔滨工程大学计算机科学与技术学院) Singapore University of Technology and Design (SUTD), Singapore(新加坡科技设计大学) Continental Automotive Singapore Pte. Ltd.

专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 DAOS数据集通过多模态数据和动作-物体关系网络提升驾驶员行为识别的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13207 2026-01-21 cs.CV 70%

GTPred: Benchmarking MLLMs for Interpretable Geo-localization and Time-of-capture Prediction

GTPred:评估多模态大语言模型在可解释地理定位和拍摄时间预测中的基准测试

Jinnao Li, Zijian Chen, Tingzhu Chen, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究院) School of Humanities, Shanghai Jiao Tong University(上海交通大学人文学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 GTPred是一个新的地理-时间预测基准测试,通过评估多模态大语言模型在可解释地理定位和拍摄时间预测中的表现,揭示了当前模型在世界知识和时空推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10671 2026-01-21 cs.CV cs.AI 62%

Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey

基于图像-语言基础模型的图像到视频迁移学习:全面综述

Jinxuan Li, Chaolei Tan, Haoxuan Chen, Jianxin Ma, Jian-Fang Hu, Jianhuang Lai, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了基于图像-语言基础模型的图像到视频迁移学习,系统分类了现有技术并分析了其在视频-文本任务中的应用与挑战。

Comments Updated version, github repository is available at https://github.com/YuriPreisdent/awesome-image-to-video-transfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14250 2026-01-21 cs.CV 57%

OmniTransfer: All-in-one Framework for Spatio-temporal Video Transfer

OmniTransfer: 一种用于时空视频转换的综合框架

Pengze Zhang, Yanze Wu, Mengtian Li, Xu Bai, Songtao Zhao, Fulong Ye, Chong Mou, Xinghui Li, Zhuowei Chen, Qian He, Mingyuan Gao

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 OmniTransfer通过统一框架实现灵活的高保真视频生成,结合多视角和时间线索提升转换性能。

Comments Github Page: https://pangzecheung.github.io/OmniTransfer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19546 2026-01-21 cs.CV 57%

ActAvatar: Temporally-Aware Precise Action Control for Talking Avatars

ActAvatar: 时空感知的精确动作控制用于对话虚拟角色

Ziqiao Peng, Yi Chen, Yifeng Ma, Guozhen Zhang, Zhiyao Sun, Zixiang Zhou, Youliang Zhang, Zhengguang Zhou, Zhaoxin Fan, Hongyan Liu, Yuan Zhou, Qinglin Lu, Jun He

机构 * Renmin University of China(中国人民大学) Tencent Hunyuan(腾讯文yne) Tsinghua University(清华大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV

AI总结 ActAvatar通过文本引导实现对话虚拟角色的相位级动作控制,引入相位感知交叉注意力、渐进式音频-视觉对齐和双阶段训练策略,提升动作控制精度和视觉质量。

Comments Project Page: https://ziqiaopeng.github.io/ActAvatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11634 2026-01-21 cs.CV 57%

When Rules Fall Short: Agent-Driven Discovery of Emerging Content Issues in Short Video Platforms

当规则不足时:基于智能体的短视频平台新兴内容问题发现

Chenghui Yu, Hongwei Wang, Junwen Chen, Zixuan Wang, Bingfeng Deng, Zhuolin Hao, Hongyu Xiong, Yang Song

机构 * TikTok Inc.(TikTok公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于多模态大语言模型智能体的自动问题发现方法,有效提升短视频平台新兴内容问题的发现与治理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11857 2026-01-21 physics.optics physics.app-ph physics.class-ph 50%

Integrated nano electro-optomechanical spiking neuron

集成的纳米电光机械脉冲神经元

Gregorio Beltramo, Róbert Horváth, Grégoire Beaudoin, Isabelle Sagnes, Sylvain Barbay, Rémy Braive

专题命中 视频多模态 :multimodal(abstract)

AI总结 该研究展示了一种集成纳米电光机械脉冲神经元,实现高效数据处理与多模功能,适用于低延迟边缘计算和脑启发光学机械计算。

Comments 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 12 篇

2601.04720 2026-01-21 cs.CL 83%

Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking

Qwen3-VL-Embedding 和 Qwen3-VL-Reranker:面向最新多模态检索与排序的统一框架

Mingxin Li, Yanzhao Zhang, Dingkun Long, Keqin Chen, Sibo Song, Shuai Bai, Zhibo Yang, Pengjun Xie, An Yang, Dayiheng Liu, Jingren Zhou, Junyang Lin

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CL

AI总结 Qwen3-VL-Embedding和Qwen3-VL-Reranker通过统一框架实现多模态检索与排序的高精度性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05014 2026-01-21 cs.AI cs.LG 83%

Think Then Embed: Generative Context Improves Multimodal Embedding

思考后再嵌入:生成性上下文提升多模态嵌入

Xuanming Cui, Jianpeng Cheng, Hong-you Chen, Satya Narayan Shukla, Abhijeet Awasthi, Xichen Pan, Chaitanya Ahuja, Shlok Kumar Mishra, Yonghuan Yang, Jun Xiao, Qi Guo, Ser-Nam Lim, Aashu Singh, Xiangjun Fan

机构 * AI at Meta(Meta人工智能部门) University of Central Florida(中央佛罗里达大学) New York University(纽约大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本研究提出Think-Then-Embed框架,通过生成性推理提升多模态嵌入性能,实现更高效的复杂指令处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07780 2026-01-21 cs.CV cs.AI 81%

Semantic-Consistent Bidirectional Contrastive Hashing for Noisy Multi-Label Cross-Modal Retrieval

语义一致的双向对比哈希用于噪声多标签跨模态检索

Likang Peng, Chao Su, Wenyuan Wu, Yuan Sun, Dezhong Peng, Xi Peng, Xu Wang

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出语义一致的双向对比哈希方法,通过跨模态语义一致性分类和双向软对比哈希模块,有效应对多标签数据中的噪声问题,提升跨模态检索的鲁棒性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11970 2026-01-21 cs.CV 79%

Real-Time Multi-Modal Embedded Vision Framework for Object Detection Facial Emotion Recognition and Biometric Identification on Low-Power Edge Platforms

面向低功耗边缘平台的实时多模态嵌入视觉框架:用于目标检测、面部情绪识别和生物识别

S. M. Khalid Bin Zahid, Md. Rakibul Hasan Nishat, Abdul Hasib, Md. Rakibul Hasan, Md. Ashiqussalehin, Md. Sahadat Hossen Sajib, A. S. M. Ahsanul Sarkar Akib

机构 * 1,2Department of Mechatronics Engineering, Rajshahi University of Engineering \& Technology 3 ,4,5Department of Internet of Things Robotics Engineering, University of Frontier Technology, Bangladesh 6Department of Computer Science Engineering, Varendra University, Rajshahi, Bangladesh 7Department of Robotics, Robo Tech Valley, Dhaka, Bangladesh Emails: , , 3

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种面向低功耗边缘平台的实时多模态视觉框架,通过自适应调度机制整合目标检测、面部识别和情绪检测,提升边缘设备上的智能感知效率与隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12486 2026-01-21 cs.HC 78%

A Multimodal Assistive System for Product Localization and Retrieval for People who are Blind or have Low Vision

一种多模态辅助系统,用于帮助盲人或低视力者进行产品定位与检索

Ligao Ruan, Giles Hamilton-Fletcher, Mahya Beheshti, Todd E Hudson, Maurizio Porfiri, John-Ross Rizzo

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出一种多模态辅助系统,通过目标检测与视觉-语言模型结合,帮助盲人或低视力者自主完成产品定位与检索,提升其自主性和控制感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14154 2026-01-21 cs.CV cs.AI 76%

LLM Augmented Intervenable Multimodal Adaptor for Post-operative Complication Prediction in Lung Cancer Surgery

基于大语言模型的可干预多模态适配器用于肺癌手术后并发症预测

Shubham Pandey, Bhavin Jawade, Srirangaraj Setlur, Venu Govindaraju, Kenneth Seastedt

机构 * University at Buffalo(布法罗大学) Roswell Park Comprehensive Cancer Center(罗斯威尔帕克综合癌症中心)

专题命中 跨模态检索 :multimodal(title);分类 cs.CV、cs.AI

AI总结 MIRACLE通过整合术前临床和放射学数据,利用超球面嵌入空间和干预式深度学习模块,实现肺癌手术后并发症风险的预测与可解释性管理。

Comments Accepted to P2P-CV @ WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14259 2026-01-21 cs.CV 70%

ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation

ManipShield: 一种用于图像篡改检测、定位和解释的统一框架

Zitong Xu, Huiyu Duan, Xiaoyu Wang, Zhaolin Cai, Kaiwei Zhang, Qiang Hu, Jing Liu, Xiongkuo Min, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) University of Electronic and Science Technology of China(电子科技大学) Tianjin University(天津大学)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 ManipShield基于多模态大语言模型,通过对比学习LoRA微调和任务特定解码器,实现图像篡改的统一检测、定位和解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14121 2026-01-21 cs.CL 57%

NewsRECON: News article REtrieval for image CONtextualization

NewsRECON: 用于图像上下文化的新闻文章检索

Jonathan Tonglet, Iryna Gurevych, Tinne Tuytelaars, Marie-Francine Moens

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(通用知识处理实验室(UKP实验室)、计算机科学系、图恩大学(TU Darmstadt)和应用网络安全国家研究中心ATHENE) Department of Electrical Engineering, KU Leuven(电气工程系、鲁汶大学) Department of Computer Science, KU Leuven(计算机科学系、鲁汶大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 NewsRECON通过链接图像与相关新闻文章,利用元数据推断图像日期和位置,优于现有方法并结合多模态大语言模型实现新的SOTA结果。

Comments Preprint under review. Code available at https://github.com/jtonglet/arxiv2025-newsrecon

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14060 2026-01-21 cs.CV 57%

Fine-Grained Zero-Shot Composed Image Retrieval with Complementary Visual-Semantic Integration

细粒度零样本组合图像检索与互补视觉-语义整合

Yongcong Ye, Kai Zhang, Yanghai Zhang, Enhong Chen, Longfei Li, Jun Zhou

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Zhejiang University(浙江大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CVSI方法,通过互补视觉-语义整合提升细粒度零样本组合图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13476 2026-01-21 cs.LG cs.AI 57%

A Unified Variational Imputation Framework for Electric Vehicle Charging Data Using Retrieval-Augmented Language Model

基于检索增强语言模型的统一变分填补框架用于电动汽车充电数据

Jinhao Li, Hao Wang

机构 * Department of Data Science and AI, Faculty of IT and Monash Energy Institute, Monash University(数据科学与人工智能系,信息科技学院和莫纳什能源研究所,莫纳什大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出PRAIM框架,利用检索增强语言模型和变分神经架构,提升电动汽车充电数据填补的准确性和统计分布保留能力,从而提高预测性能。

Comments 15 pages

Journal ref IEEE Transactions on Smart Grid, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23770 2026-01-21 cs.CV 57%

GenView++: Unifying Adaptive Generative Augmentation and Quality-Driven Supervision for Contrastive Representation Learning

GenView++:统一自适应生成增强和质量驱动监督以实现对比表征学习

Xiaojie Li, Bei Wang, Wei Liu, Jianlong Wu, Yue Yu, Liqiang Nie, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

AI总结 GenView++通过自适应生成增强和质量驱动监督,提升对比学习在视觉和视觉-语言任务中的性能。

Comments The code is available at \url{https://github.com/xiaojieli0903/GenViewPlusPlus}

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12010 2026-01-21 cs.CV 57%

SMc2f: Robust Scenario Mining for Robotic Autonomy from Coarse to Fine

SMc2f: 从粗到细的机器人自主性鲁棒场景挖掘

Yifei Chen, Ross Greer

机构 * Department of Computer Science at Xi’an University of Technology(西安理工大学计算机科学系) department of Computer Science & Engineering at the University of California, Merced(加州大学默塞德分校计算机科学与工程系)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

AI总结 SMc2f通过从粗到细的流程,利用视觉语言模型和文本-轨迹对比学习提升机器人场景挖掘的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 19 篇

2512.16899 2026-01-21 cs.CL cs.CV 81%

Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image

多模态奖励基准2:评估多模态奖励模型用于交错文本和图像

Yushi Hu, Reyhane Askari-Hemmat, Melissa Hall, Emily Dinan, Luke Zettlemoyer, Marjan Ghazvininejad

机构 * FAIR at Meta Superintelligence Labs(Meta超智能实验室的FAIR)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 多模态奖励基准2评估多模态奖励模型在交错文本和图像任务中的性能,通过专家标注数据和先进模型对比,揭示了不同模型在多模态理解与生成任务中的准确率差异。

Comments Code and data available at https://github.com/facebookresearch/MMRB2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11614 2026-01-21 cs.CV cs.LG q-bio.NC 79%

Multi-modal MRI-Based Alzheimer's Disease Diagnosis with Transformer-based Image Synthesis and Transfer Learning

基于多模态MRI的阿尔茨海默病诊断:基于Transformer的图像合成与迁移学习

Jason Qiu

机构 * Marvin Ridge High School(马文岭高中)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本研究提出基于Transformer的图像合成方法,利用T1w MRI预测FA和MD,提升AD诊断准确率和MCI检测能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12381 2026-01-21 q-bio.QM q-bio.BM q-bio.GN 78%

Multimodal Spatial Omics: From Data Acquisition to Computational Integration

多模态空间组学:从数据获取到计算整合

Esra Busra Isik, Yusuf Hakan Usta, Haozhe Liu, Maryam Riazi, William Roach, Hongpeng Zhou, Magnus Rattray, Sokratia Georgaka

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文综述了多模态空间组学数据整合的计算方法,涵盖从概率模型到深度学习的多种算法原理,以整合不同分子层和图像数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12277 2026-01-21 cs.RO 78%

An Efficient and Multi-Modal Navigation System with One-Step World Model

一种高效且多模态的导航系统与一步世界模型

Wangtian Shen, Ziyang Meng, Jinming Ma, Mingliang Zhou, Diyun Xiang

机构 * Tsinghua University(清华大学) Xiaomi (China)(小米(中国))

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出了一种高效多模态导航系统,通过一步世界模型和3D U-Net骨干网络,提升导航效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11540 2026-01-21 cs.HC 78%

Exploring General-Purpose Autonomous Multimodal Agents for Pathology Report Generation

探索通用型自主多模态代理用于病理报告生成

Marc Aubreville, Taryn A. Donovan, Christof A. Bertram

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 研究探索通用型自主多模态代理在病理报告生成中的应用,发现其在无额外信息时诊断准确率较低,但提供形态学描述时表现更佳,但仍不及人类专家。

Comments 6 pages, 1 figure, accepted paper for BVM 2026

Journal ref BVM 2026, https://bvm-conf.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11689 2026-01-21 eess.IV cs.CV 70%

Bridging Modalities: Joint Synthesis and Registration Framework for Aligning Diffusion MRI with T1-Weighted Images

弥合模态:联合合成与配准框架用于对齐扩散磁共振成像与T1加权图像

Xiaofan Wang, Junyi Wang, Yuqian Chen, Lauren J. O' Donnell, Fan Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Brigham and Women’s Hospital(布里奇沃特医院) Harvard Medical School(哈佛医学院)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于生成配准网络的无监督框架,通过图像合成和变形场学习,提升扩散MRI与T1加权图像的配准精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14041 2026-01-21 cs.CL cs.AI 62%

Top 10 Open Challenges Steering the Future of Diffusion Language Model and Its Variants

推动扩散语言模型及其变体未来发展的十大开放挑战

Yunhe Wang, Kai Han, Huiling Zhen, Yuchuan Tian, Hanting Chen, Yongbing Huang, Yufei Cui, Yingte Shu, Shan Gao, Ismail Elezi, Roy Vaughan Miles, Songcen Xu, Feng Wen, Chao Xu, Sinan Zeng, Dacheng Tao

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Peking University(北京大学) Huawei Technologies(华为技术有限公司) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出推动扩散语言模型及其变体发展的十大挑战,并提出以多尺度标记化、主动遮罩和潜在思考为核心的四支柱战略路线图,旨在突破因果瓶颈,实现复杂结构推理和多模态整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13846 2026-01-21 cs.AI cs.CY cs.LG 57%

Virtual Urbanism: An AI-Driven Framework for Quantifying Urban Identity. A Tokyo-Based Pilot Study Using Diffusion-Generated Synthetic Environments

虚拟城市主义:一种基于AI的量化城市身份框架。以东京为基础的试点研究,使用扩散生成的合成环境

Glinskaya Maria

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出虚拟城市主义框架,利用AI生成合成环境量化城市身份,通过东京试点研究验证其有效性,揭示核心身份形成元素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02314 2026-01-21 cs.IT cs.AI math.IT 57%

Large AI Models for Wireless Physical Layer

大规模人工智能模型用于无线物理层

Jiajia Guo, Yiming Cui, Shi Jin, Jun Zhang

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) National Mobile Communications Research Laboratory, Southeast University(国家移动通信研究中心,东南大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出利用大规模人工智能模型改进无线物理层通信,通过预训练模型和专用模型策略提升性能与适应性,并探讨未来研究方向。

Comments A collection of paper on Large AI Models for wireless physical layer can be found at https://github.com/AI4Wireless/LAM4PHY_6G

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19498 2026-01-21 cs.CL 57%

DomainCQA: Crafting Knowledge-Intensive QA from Domain-Specific Charts

DomainCQA: 从领域特定图表中构建知识密集型问答

Yujing Lu, Ling Zhong, Jing Yang, Weiming Li, Peng Wei, Yongheng Wang, Manni Duan, Qing Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 DomainCQA通过构建领域特定图表问答基准测试,提升多模态大语言模型在视觉理解和知识密集型推理方面的能力。

Comments 83 pages, 59 figures

详情

展开后加载摘要…

URL PDF HTML 收藏