arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-15 至 2026-01-15 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 8 篇

2511.11134 2026-01-15 cs.AI 83%

GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models

GGBench: 一种用于统一多模态模型的几何生成推理基准

Jingxuan Wei, Caijun Jia, Xi Bai, Xinglong Xu, Siyuan Li, Linzhuang Sun, Bihui Yu, Conghui He, Lijun Wu, Cheng Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 GGBench通过几何构造评估统一多模态模型的生成推理能力,推动智能系统发展。

Comments 35 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08183 2026-01-15 cs.CV cs.AI 81%

GI-Bench: A Panoramic Benchmark Revealing the Knowledge-Experience Dissociation of Multimodal Large Language Models in Gastrointestinal Endoscopy Against Clinical Standards

GI-Bench: 一个全景基准测试,揭示多模态大语言模型在内窥镜检查中与临床标准相比的知识-经验脱节

Yan Zhu, Te Luo, Pei-Yao Fu, Zhen Zhang, Zi-Long Wang, Yi-Fan Qu, Zi-Han Geng, Jia-Qi Xu, Lu Yao, Li-Yun Ma, Wei Su, Wei-Feng Chen, Quan-Lin Li, Shuo Wang, Ping-Hong Zhou

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 GI-Bench通过评估多模态大语言模型在胃肠内窥镜中的性能,揭示其在诊断推理和空间定位方面的不足,发现模型在语言流畅度上优于人类,但事实准确性较低。

Comments 45 pages, 17 figures, 6 tables. Leaderboard available at: https://roterdl.github.io/GIBench/ . Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09613 2026-01-15 cs.CV cs.AI 62%

CogRail: Benchmarking VLMs in Cognitive Intrusion Perception for Intelligent Railway Transportation Systems

CogRail: 对智能铁路运输系统中认知入侵感知的视觉语言模型进行基准测试

Yonglin Tian, Qiyao Zhang, Wei Xu, Yutong Wang, Yihao Wu, Xinyi Li, Xingyuan Dai, Hui Zhang, Zhiyong Cui, Baoqing Guo, Zujun Yu, Yisheng Lv

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Signal & Communication Research Institute, China Academy of Railway Sciences(信号与通信研究所,中国铁路科学研究院) Beijing Huairou Academy of Parallel Sensing(北京怀柔平行感知院) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(智能交通系统国家重点实验室,交通科学与工程学院,北京航空航天大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CogRail提出一个用于评估视觉语言模型在认知入侵感知任务中性能的基准,通过联合微调框架提升模型在时空推理和威胁分析中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09555 2026-01-15 cs.CL cs.AI 62%

Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats

在微缩浮点格式下对大语言模型进行后训练量化评估

Manyi Zhang, Ji-Fu Li, Zhongao Sun, Haoli Bai, Hui-Ling Zhen, Zhenhua Dong, Xianzhi Yu

机构 * Huawei Technologies(华为技术)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在微缩浮点格式下大语言模型后训练量化的效果,发现MXFP8性能接近无损,而MXFP4存在显著精度损失,且格式兼容性对PTQ效果影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09433 2026-01-15 cs.CV cs.AI cs.LG 62%

Do Transformers Understand Ancient Roman Coin Motifs Better than CNNs?

Transformer 是否比 CNN 更能理解古代罗马硬币图案?

David Reid, Ognjen Arandjelovic

机构 * School of Computer Science University of St Andrews(计算机科学学院苏格兰大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文首次将Transformer应用于古代硬币语义元素识别,发现其在准确性上优于CNN模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09416 2026-01-15 cs.CV cs.AI 62%

Radiomics-Integrated Deep Learning with Hierarchical Loss for Osteosarcoma Histology Classification

融合放射组学的深度学习与分层损失用于骨肉瘤组织学分类

Yaxi Chen, Zi Ye, Shaheer U. Saeed, Oliver Yu, Simin Ni, Jie Huang, Yipeng Hu

机构 * University College London(伦敦大学) UCL Hawkes Institute(UCL霍克斯研究所) Queen Mary University of London(伦敦女王学院) Royal National Orthopaedic Hospital(国家骨科医院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出融合放射组学的深度学习与分层损失方法,用于提高骨肉瘤组织学分类的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09209 2026-01-15 cs.CV 57%

Pairing-free Group-level Knowledge Distillation for Robust Gastrointestinal Lesion Classification in White-Light Endoscopy

无需配对的群体级知识蒸馏用于白光内镜中胃肠道病变的鲁棒分类

Qiang Hu, Qimei Wang, Yingjie Guo, Qiang Li, Zhiwei Wang

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出PaGKD,一种无需配对的群体级知识蒸馏框架,通过未配对的WLI和NBI数据实现跨模态学习,显著提升胃肠道病变分类性能。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08977 2026-01-15 cs.CV 57%

Thermo-LIO: A Novel Multi-Sensor Integrated System for Structural Health Monitoring

Thermo-LIO:一种用于结构健康监测的新型多传感器集成系统

Chao Yang, Haoyuan Zheng, Yue Ma

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 Thermo-LIO 通过融合热成像与高分辨率 LiDAR,提升大规模结构健康监测的精度和覆盖范围。

Comments 27pages,12figures

详情

展开后加载摘要…

URL PDF HTML 收藏