arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-15 至 2025-12-15 共收录 42 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 9 篇

2512.11680 2025-12-15 cs.CV 88%

Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing

跨模态上下文感知学习:用于遥感中视觉提示引导的多模态图像理解

Xu Zhang, Jiabin Fang, Zhuoming Ding, Jin Yuan, Xuan Liu, Qianjun Zhang, Zhiyong Li

机构 * College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) School of Robotics and the National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人学院及机器人视觉感知与控制技术国家工程研究中心,湖南大学) School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算与人工智能学院,西南交通大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV

AI总结 CLV-Net通过跨模态上下文感知学习,利用视觉提示引导遥感多模态图像理解,提升目标识别精度和用户意图对齐能力。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11683 2025-12-15 cs.CV 79%

Depth-Copy-Paste: Multimodal and Depth-Aware Compositing for Robust Face Detection

深度复制-粘贴:多模态和深度感知的复合技术用于鲁棒人脸检测

Qiushi Guo

机构 * Coffee AI Lab, Great Wall Motor(GWM), China(咖啡AI实验室,长城汽车(GWM),中国)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 深度复制-粘贴通过多模态和深度感知的增强方法,生成多样且物理一致的训练数据,提升人脸检测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21451 2025-12-15 cs.CV 79%

MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning

MM-SeR: 多模态自反思用于轻量级图像描述

Junha Song, Yongsik Jo, So Yeon Min, Quanting Xie, Taehwan Kim, Yonatan Bisk, Jaegul Choo

机构 * KAIST(韩国科学技术院) UNIST(全南国立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 MM-SeR通过轻量级多模态自反思框架,在减少计算成本的同时,实现了与大规模模型相当的图像描述性能,并扩展到长距离视频问答任务。

Comments Project page: https://sites.google.com/view/junha/mm-ser

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09348 2025-12-15 cs.CL cs.AI cs.CV 67%

MOAT: Evaluating LMMs for Capability Integration and Instruction Grounding

MOAT:评估LMMs在能力整合和指令接地方面的表现

Zhoutong Ye, Mingze Sun, Huan-ang Gao, Xutong Wang, Xiangyang Wang, Yu Mei, Chang Liu, Qinwei Li, Chengwen Zhang, Qinghuan Lan, Chun Yu, Yuanchun Shi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MOAT通过1005个复杂现实视觉问题评估LMMs在能力整合和指令接地方面的表现,发现最佳模型仅达44%准确率,揭示了LMMs在复杂任务中的不足。

Comments Project page: https://cambrian-yzt.github.io/MOAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11167 2025-12-15 cs.CV cs.AI 62%

Image Tiling for High-Resolution Reasoning: Balancing Local Detail with Global Context

图像分块用于高分辨率推理:在局部细节与全局上下文之间取得平衡

Anatole Jacquin de Margerie, Alexis Roger, Irina Rish

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过图像分块技术实现高分辨率图像理解,验证了局部细节恢复的有效性,并探讨了全局上下文对模型性能的影响。

Comments Accepted in AAAI 2025 Workshop on Reproducible AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11015 2025-12-15 cs.CV cs.AI cs.LG 62%

Leveraging Text Guidance for Enhancing Demographic Fairness in Gender Classification

利用文本引导提升面部性别分类中的群体公平性

Anoop Krishnan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过文本引导方法提升面部性别分类中的群体公平性,利用图像文本匹配和融合策略减少偏见并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17982 2025-12-15 cs.CV 57%

Few-Shot Learning from Gigapixel Images via Hierarchical Vision-Language Alignment and Modeling

通过层次化视觉-语言对齐和建模实现高像素图像的少样本学习

Bryan Wong, Jong Woo Kim, Huazhu Fu, Mun Yong Yi

机构 * KAIST(韩国科学技术院) IHPC, A*STAR(A*STAR研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 HiVE-MIL通过层次化视觉-语言对齐和建模,提升高像素图像的少样本学习性能,实现4.1%的宏F1提升。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11060 2025-12-15 cs.CV 57%

Synthetic Vasculature and Pathology Enhance Vision-Language Model Reasoning

合成血管和病理增强视觉-语言模型推理

Chenjun Li, Cheng Wan, Laurin Lux, Alexander Berger, Richard B. Rosen, Martin J. Menten, Johannes C. Paetzold

机构 * Cornell University(康奈尔大学) Weill Cornell Medicine(韦尔·康奈尔医学) Technical University of Munich(慕尼黑技术大学) New York Eye and Ear Infirmary of Mount Sinai(圣文森特医院) Cornell Tech(康奈尔科技)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本研究提出合成血管推理框架,通过生成具有糖尿病视网膜病变特征的图像和文本,提升视觉-语言模型在OCTA图像诊断中的推理能力与病理定位精度。

Comments 23 pages, 8 figures, 6 tables. Full paper under review for MIDL 2026 (Medical Imaging with Deep Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11109 2025-12-15 cs.LG 50%

Limits and Gains of Test-Time Scaling in Vision-Language Reasoning

视觉语言推理中测试时扩展的极限与收益

Mohammadjavad Ahmadpour, Amirmahdi Meighani, Payam Taebi, Omid Ghahroodi, Amirmohammad Izadi, Mahdieh Soleymani Baghshah

专题命中 图文多模态 :multimodal(abstract)

AI总结 研究探讨了测试时扩展在视觉语言推理中的效果,发现其在不同任务和模型上表现不一,需根据具体需求定制策略。

Comments Mohammadjavad Ahmadpour and Amirmadhi Meighani contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2512.10963 2025-12-15 cs.IR cs.AI cs.HC cs.LG cs.MM 84%

Emotion-Driven Personalized Recommendation for AI-Generated Content Using Multi-Modal Sentiment and Intent Analysis

基于多模态情感与意图分析的情绪驱动个性化推荐

Zheqi Hu, Xuanjing Chen, Jinlin Hu

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 本研究提出基于多模态情感与意图分析的情绪驱动个性化推荐模型,通过融合视觉、听觉和文本信息提升推荐效果,实验显示在F1得分和损失上均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18234 2025-12-15 cs.AI cs.CL cs.LG 62%

The Illusion of Readiness in Health AI

健康AI中的“准备”幻觉

Yu Gu, Jingjing Fu, Xiaodong Liu, Jeya Maria Jose Valanarasu, Noel CF Codella, Reuben Tan, Qianchu Liu, Ying Jin, Sheng Zhang, Jinyu Wang, Rui Wang, Lei Song, Guanghui Qin, Naoto Usuyama, Cliff Wong, Hao Cheng, HoHin Lee, Praneeth Sanapathi, Sarah Hilado, Tristan Naumann, Javier Alvarez-Valle, Jiang Bian, Mu Wei, Khalil Malik, Lidong Zhou, Jianfeng Gao, Eric Horvitz, Matthew P. Lungren, Doug Burger, Eric Topol, Hoifung Poon, Paul Vozila

机构 * Scripps Research Translational Institute(斯克里普斯研究转化研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对抗性压力测试揭示了健康AI在现实应用中的鲁棒性和推理能力不足,强调了对AI系统责任和真实医疗需求的重视。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2512.11178 2025-12-15 cs.LG cs.SI 71%

Harnessing Rich Multi-Modal Data for Spatial-Temporal Homophily-Embedded Graph Learning Across Domains and Localities

利用丰富的多模态数据进行跨领域和地域的时空同质性嵌入图学习

Takuya Kurihana, Xiaojian Zhang, Wing Yee Au, Hon Yung Wong

机构 * Fujitsu Research of America(富士通美国研究机构) Department of Civil and Coastal Engineering University of Florida(佛罗里达大学土木与海岸工程系)

专题命中 视频多模态 :multi-modal(title)

AI总结 本文提出一种跨领域和地域的时空同质性嵌入图学习框架,通过整合多模态数据提升城市预测性能,解决智能城市分析中的关键挑战。

Comments 18 pages, 8 figures, Presented in part at the 2025 INFORMS Annual Meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11510 2025-12-15 cs.CV 57%

Reconstruction as a Bridge for Event-Based Visual Question Answering

重建作为事件驱动视觉问答的桥梁

Hanyue Lou, Jiayi Zhou, Yang Zhang, Boyu Li, Yi Wang, Guangnan Ye, Boxin Shi

机构 * Peking University(北京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于重建的框架,通过FRT和ART方法提升事件驱动视觉问答性能,并引入EvQA基准验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11189 2025-12-15 cs.CV 57%

Multi-task Learning with Extended Temporal Shift Module for Temporal Action Localization

多任务学习与扩展时间移位模块用于时间动作定位

Anh-Kiet Duong, Petra Gomez-Krämer

机构 * L3i Laboratory, La Rochelle University(拉罗谢尔大学L3i实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于扩展时间移位模块的多任务学习方法,用于多视角多模态视频中的时间动作定位,通过引入背景类别和加权集成策略提升了预测的鲁棒性和一致性。

Comments BinEgo360@ICCV25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23158 2025-12-15 cs.LG cs.AI 57%

Deep Learning-Based Detection of Cognitive Impairment from Passive Smartphone Sensing with Routine-Aware Augmentation and Demographic Personalization

基于深度学习的被动智能手机传感认知障碍检测:具有常规感知增强和人口统计学个性化

Yufei Shen, Ji Hwan Park, Minchao Huang, Jared F. Benge, Justin F. Rousseau, Rosemary A. Lester-Smith, Edison Thomaz

机构 * Department of Electrical and Computer Engineering, Cockrell School of Engineering, The University of Texas at Austin(电气与计算机工程系,Cockrell工程学院,德克萨斯大学奥斯汀分校) Department of Neurology, Dell Medical School, The University of Texas at Austin(神经病学系,德克萨斯医学学院,德克萨斯大学奥斯汀分校) Department of Neurology, University of Texas Southwestern Medical Center(神经病学系,德克萨斯西南医学中心) Peter O’Donnell Jr. Brain Institute, University of Texas Southwestern Medical Center(彼得·奥·唐纳德·杰罗姆脑研究所,德克萨斯西南医学中心) Department of Speech, Language, and Hearing Sciences, Moody College of Communication, The University of Texas at Austin(语言病理学系,摩依学院,德克萨斯大学奥斯汀分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于深度学习的被动智能手机传感方法,通过常规感知增强和人口统计学个性化技术,提高模型在老年人认知障碍检测中的泛化能力。

Comments Accepted at 2025 IEEE EMBS International Conference on Biomedical and Health Informatics (IEEE BHI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11245 2025-12-15 cs.HC 50%

Breast-Rehab: A Postoperative Breast Cancer Rehabilitation Training Assessment System Based on Human Action Recognition

Breast-Rehab: 一种基于人体动作识别的术后乳腺癌康复训练评估系统

Zikang Chen, Tan Xie, Qinchuan Wang, Heming Zheng, Xudong Lu

专题命中 视频多模态 :multi-modal(abstract)

AI总结 Breast-Rehab通过结合人体动作识别与RAG框架,提供低成本的居家乳腺癌术后上肢康复训练评估系统,提升患者康复依从性。

Comments has been accepted by CHIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 1 篇

2512.11490 2025-12-15 cs.CV cs.IR 83%

VLM2GeoVec: Toward Universal Multimodal Embeddings for Remote Sensing

VLM2GeoVec:迈向通用遥感多模态嵌入

Emanuel Sánchez Aimar, Gulnaz Zhambulova, Fahad Shahbaz Khan, Yonghao Xu, Michael Felsberg

机构 * Linköping University(_linköping大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 VLM2GeoVec通过单编码器对比学习实现遥感多模态嵌入,统一可扩展检索与区域推理,提升遥感场景分析的连贯性。

Comments 21 pages, 7 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 7 篇

2512.11464 2025-12-15 cs.CV cs.AI cs.LG 81%

Exploring MLLM-Diffusion Information Transfer with MetaCanvas

探索MLLM-扩散信息传输与MetaCanvas

Han Lin, Xichen Pan, Ziqi Huang, Ji Hou, Jialiang Wang, Weifeng Chen, Zecheng He, Felix Juefei-Xu, Junzhe Sun, Zhipeng Fan, Ali Thabet, Mohit Bansal, Chu Wang

机构 * Meta Superintelligence Labs(Meta 超智能实验室) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MetaCanvas通过使MLLMs在潜在空间中推理和规划,提升多模态生成的精确度和结构化控制。

Comments Project page: https://metacanvas.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04359 2025-12-15 eess.SP 78%

Efficient Domain Generalization in Wireless Networks with Scarce Multi-Modal Data

在稀缺多模态数据下实现无线网络高效领域泛化

Minsu Kim, Walid Saad, Doru Calin

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出了一种两阶段学习框架,通过基于物理的损失函数和协作域适应方法,在稀缺多模态数据下提升无线网络的领域泛化性能。

Comments Submitted to IEEE TWC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10041 2025-12-15 cs.CV cs.AI 62%

MetaVoxel: Joint Diffusion Modeling of Imaging and Clinical Metadata

MetaVoxel:联合图像与临床元数据的扩散建模

Yihao Liu, Chenyu Gao, Lianrui Zuo, Michael E. Kim, Brian D. Boyd, Lisa L. Barnes, Walter A. Kukull, Lori L. Beason-Held, Susan M. Resnick, Timothy J. Hohman, Warren D. Taylor, Bennett A. Landman

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MetaVoxel通过联合扩散建模统一图像与临床元数据,实现图像生成、年龄估计和性别预测,性能媲美传统任务特定模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24379 2025-12-15 cs.CV cs.AI 62%

Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation

Any2Caption:任何条件到字幕以实现可控视频生成

Shengqiong Wu, Weicai Ye, Jiahao Wang, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * Kuaishou Technology(快手科技) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Any2Caption通过多模态大语言模型实现任何条件到字幕的可控视频生成,提升视频生成的可控性和质量。

Comments Project Page: https://sqwu.top/Any2Cap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11719 2025-12-15 cs.CV 57%

Referring Change Detection in Remote Sensing Imagery

遥感图像中的指称变化检测

Yilmaz Korkmaz, Jay N. Paranjape, Celso M. de Melo, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) DEVCOM U.S. Army Research Laboratory(美国陆军研究实验室)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出指称变化检测方法,通过自然语言提示实现遥感图像中特定类别的变化检测,并引入两阶段框架提升数据生成效率。

Comments 2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14040 2025-12-15 cs.LG cs.AI cs.RO 57%

WARPD: World model Assisted Reactive Policy Diffusion

WARPD:世界模型辅助的反应策略扩散

Shashank Hegde, Satyajeet Das, Gautam Salhotra, Gaurav S. Sukhatme

机构 * University of Southern California(南加州大学) Google(谷歌) Intrinsic LLC(Intrinsic 公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 WARPD通过直接生成闭环策略,提高了机器人任务中长动作时间跨度和鲁棒性的性能,同时显著降低了推理成本。

Comments Outstanding Paper Award at the Embodied World Models for Decision Making Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10991 2025-12-15 cs.LG cs.AI physics.chem-ph q-bio.QM 57%

MolSculpt: Sculpting 3D Molecular Geometries from Chemical Syntax

MolSculpt:从化学语法雕刻3D分子几何

Zhanpeng Chen, Weihao Gao, Shunyu Wang, Yanan Zhu, Hong Meng, Yuexian Zou

机构 * AI for Science (AI4S)-Preferred Program, Peking University Shenzhen Graduate School, China(人工智能科学(AI4S)优选计划,北京大学深圳研究生院,中国) Faculty of Materials Science, Shenzhen MSU-BIT University, Shenzhen, China(材料科学学院,深圳MSU-BIT大学,中国)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

AI总结 MolSculpt通过整合1D化学知识与3D生成过程,实现了从化学语法到精确3D分子几何的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 8 篇

2507.13092 2025-12-15 cs.LG cs.HC 88%

Uncertainty-Aware Cross-Modal Knowledge Distillation with Prototype Learning for Multimodal Brain-Computer Interfaces

具有原型学习的不确定性感知跨模态知识蒸馏用于多模态脑机接口

Hyo-Jeong Jang, Hye-Bin Shin, Seong-Whan Lee

机构 * Department of Brain and Cognitive Engineering, Korea University(脑科学与认知工程系,韩国大学) Department of Artificial Intelligence, Korea University(人工智能系,韩国大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract)

AI总结 本文提出一种具有原型学习的跨模态知识蒸馏框架,通过缓解模态和标签不一致问题,提升多模态脑机接口中EEG的分类和回归性能。

Comments Accepted to SMC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11558 2025-12-15 cs.CV cs.AI cs.CL 85%

DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry

DentalGPT: 促进牙科多模态复杂推理的激励机制

Zhenyang Cai, Jiaming Zhang, Junjie Zhao, Ziyi Zeng, Yanchao Li, Jingyi Liang, Junying Chen, Yunjin Yang, Jiajun You, Shuzhi Deng, Tongfei Wang, Wanting Chen, Chunxiu Hao, Ruiqi Xie, Zhenwei Wen, Xiangyi Feng, Zou Ting, Jin Zou Lin, Jianquan Li, Guangjun Yu, Liangyi Chen, Junwen Wang, Shan Jiang, Benyou Wang

机构 * Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University(南方医科大学深圳口腔医院(平山)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) State Key Laboratory of Membrane Biology, Beijing Key Laboratory of Cardiometabolic Molecular Medicine, Institute of Molecular Medicine, National Biomedical Imaging Center, School of Future Technology, Peking University(北京大学膜生物学国家重点实验室、北京心代谢分子医学重点实验室、分子医学研究院、国家生物医学成像中心、未来技术学院) Freedom AI Division of Applied Oral Sciences & Community Dental Care Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院应用口腔科学与社区牙科护理系) Beijing Institute of Collaborative Innovation(北京协同创新研究院) National Health Data Institute, Shenzhen(深圳国家健康数据研究院) Shenzhen Loop Area Institute(深圳河套学院) Shenzhen Institute of Big Data(深圳大数据研究院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 DentalGPT通过高质量数据和强化学习提升牙科多模态推理能力,实现优于现有模型的诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15351 2025-12-15 cs.AI cs.CV 81%

Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration

Octopus: 六种能力协同的代理多模态推理

Yifu Guo, Zishan Xu, Zhiyuan Yao, Yuquan Lu, Jiaye Lin, Sen Hu, Zhenheng Tang, Huacan Wang, Ronghao Chen

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Octopus通过六种能力协同实现多模态代理推理,有效提升复杂任务中的自主探索与动态能力选择能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11215 2025-12-15 cs.CV 79%

SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection

SmokeBench: 评估多模态大语言模型用于野火烟雾检测

Tianye Qi, Weihao Li, Nick Barnes

机构 * Australian National University(澳大利亚国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 SmokeBench评估多模态大语言模型在野火烟雾检测中的性能,发现模型在烟雾定位方面存在显著局限,尤其在早期阶段。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11074 2025-12-15 cs.CL cs.AI cs.LG cs.MM 67%

MultiScript30k: Leveraging Multilingual Embeddings to Extend Cross Script Parallel Data

MultiScript30k:利用多语言嵌入扩展跨脚本平行数据

Christopher Driggers-Ellis, Detravious Brinkley, Ray Chen, Aashish Dhawan, Daisy Zhe Wang, Christan Grant

机构 * Computer and Information Science and Engineering(计算机与信息科学与工程)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 MultiScript30k通过多语言嵌入扩展Multi30k数据集,支持多种脚本的全球语言,提升多模态机器翻译的多样性与覆盖范围。

Comments 7 pages, 2 figures, 5 tables. Not published at any conference at this time

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11567 2025-12-15 cs.CL cs.MM 62%

Extending a Parliamentary Corpus with MPs' Tweets: Automatic Annotation and Evaluation Using MultiParTweet

扩展议会语料库以包含议员的推文:利用MultiParTweet进行自动标注和评估

Mevlüt Bagci, Ali Abusaleh, Daniel Baumartz, Giueseppe Abrami, Maxim Konca, Alexander Mehler

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.MM

AI总结 本文提出MultiParTweet,通过自动标注和人工验证,整合了多语言推文及媒体内容,展示了模型间互为预测性及多模态注释的优越性。

Comments Submitted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏