arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-15 至 2026-01-15 共收录 44 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 8 篇

2601.09613 2026-01-15 cs.CV cs.AI 62%

CogRail: Benchmarking VLMs in Cognitive Intrusion Perception for Intelligent Railway Transportation Systems

CogRail: 对智能铁路运输系统中认知入侵感知的视觉语言模型进行基准测试

Yonglin Tian, Qiyao Zhang, Wei Xu, Yutong Wang, Yihao Wu, Xinyi Li, Xingyuan Dai, Hui Zhang, Zhiyong Cui, Baoqing Guo, Zujun Yu, Yisheng Lv

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Signal & Communication Research Institute, China Academy of Railway Sciences(信号与通信研究所,中国铁路科学研究院) Beijing Huairou Academy of Parallel Sensing(北京怀柔平行感知院) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(智能交通系统国家重点实验室,交通科学与工程学院,北京航空航天大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CogRail提出一个用于评估视觉语言模型在认知入侵感知任务中性能的基准,通过联合微调框架提升模型在时空推理和威胁分析中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09555 2026-01-15 cs.CL cs.AI 62%

Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats

在微缩浮点格式下对大语言模型进行后训练量化评估

Manyi Zhang, Ji-Fu Li, Zhongao Sun, Haoli Bai, Hui-Ling Zhen, Zhenhua Dong, Xianzhi Yu

机构 * Huawei Technologies(华为技术)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在微缩浮点格式下大语言模型后训练量化的效果,发现MXFP8性能接近无损,而MXFP4存在显著精度损失,且格式兼容性对PTQ效果影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09433 2026-01-15 cs.CV cs.AI cs.LG 62%

Do Transformers Understand Ancient Roman Coin Motifs Better than CNNs?

Transformer 是否比 CNN 更能理解古代罗马硬币图案?

David Reid, Ognjen Arandjelovic

机构 * School of Computer Science University of St Andrews(计算机科学学院苏格兰大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文首次将Transformer应用于古代硬币语义元素识别,发现其在准确性上优于CNN模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09416 2026-01-15 cs.CV cs.AI 62%

Radiomics-Integrated Deep Learning with Hierarchical Loss for Osteosarcoma Histology Classification

融合放射组学的深度学习与分层损失用于骨肉瘤组织学分类

Yaxi Chen, Zi Ye, Shaheer U. Saeed, Oliver Yu, Simin Ni, Jie Huang, Yipeng Hu

机构 * University College London(伦敦大学) UCL Hawkes Institute(UCL霍克斯研究所) Queen Mary University of London(伦敦女王学院) Royal National Orthopaedic Hospital(国家骨科医院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出融合放射组学的深度学习与分层损失方法,用于提高骨肉瘤组织学分类的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09209 2026-01-15 cs.CV 57%

Pairing-free Group-level Knowledge Distillation for Robust Gastrointestinal Lesion Classification in White-Light Endoscopy

无需配对的群体级知识蒸馏用于白光内镜中胃肠道病变的鲁棒分类

Qiang Hu, Qimei Wang, Yingjie Guo, Qiang Li, Zhiwei Wang

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出PaGKD,一种无需配对的群体级知识蒸馏框架,通过未配对的WLI和NBI数据实现跨模态学习,显著提升胃肠道病变分类性能。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08977 2026-01-15 cs.CV 57%

Thermo-LIO: A Novel Multi-Sensor Integrated System for Structural Health Monitoring

Thermo-LIO:一种用于结构健康监测的新型多传感器集成系统

Chao Yang, Haoyuan Zheng, Yue Ma

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 Thermo-LIO 通过融合热成像与高分辨率 LiDAR,提升大规模结构健康监测的精度和覆盖范围。

Comments 27pages,12figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 3 篇

2506.02955 2026-01-15 cs.RO cs.AI cs.LG 57%

UniConFlow: A Unified Constrained Flow-Matching Framework for Certified Motion Planning

UniConFlow: 一种统一的约束流匹配框架用于认证运动规划

Zewen Yang, Xiaobing Dai, Dian Yu, Zhijun Li, Majid Khadiv, Sandra Hirche, Sami Haddadin

机构 * Technical University of Munich (TUM)(技术大学慕尼黑) School of Mechanical Engineering, Translational Research Center, Tongji University(机械工程学院、转化研究中心,同济大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 UniConFlow提出一种统一约束流匹配框架,通过整合等式和不等式约束,提升轨迹生成在安全性和动态一致性上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09113 2026-01-15 cs.AI 57%

The AI Hippocampus: How Far are We From Human Memory?

人工智能海马体:我们离人类记忆还有多远?

Zixia Jia, Jiaqi Li, Yipeng Kang, Yuxuan Wang, Tong Wu, Quansen Wang, Xiaobo Wang, Shuyi Zhang, Junzhe Shen, Qing Li, Siyuan Qi, Yitao Liang, Di He, Zilong Zheng, Song-Chun Zhu

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文综述了大语言模型和多模态大语言模型中记忆机制的分类与研究进展,探讨了隐性、显性和代理记忆框架,以及多模态场景下的记忆整合与挑战。

Journal ref Transactions on Machine Learning Research (11/2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11773 2026-01-15 cs.CL 57%

AgenticIE: An Adaptive Agent for Information Extraction from Complex Regulatory Documents

AgenticIE: 一种用于从复杂监管文件中提取信息的自适应代理

Gaye Colakoglu, Gürkan Solmaz, Jonathan Fürst

机构 * Zurich University of Applied Sciences(苏黎世应用科学大学) NEC Laboratories Europe(NEC欧洲实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 本文提出AgenticIE系统,用于从复杂监管文件中提取信息和回答问题,通过高密度标注数据集验证其在KIE和QA任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 4 篇

2504.18419 2026-01-15 cs.CV cs.AI cs.RO 81%

A Multimodal Hybrid Late-Cascade Fusion Network for Enhanced 3D Object Detection

一种多模态混合后期级联融合网络用于增强的3D物体检测

Carlo Sgaravatti, Roberto Basla, Riccardo Pieroni, Matteo Corno, Sergio M. Savaresi, Luca Magri, Giacomo Boracchi

机构 * Politecnico di Milano(米兰理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种多模态混合后期级联融合网络,通过结合RGB和3D激光雷达检测器,提升3D物体检测的性能,特别是在行人和自行车检测方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09470 2026-01-15 physics.ed-ph cs.AI 80%

Personalized Multimodal Feedback Using Multiple External Representations: Strategy Profiles and Learning in High School Physics

基于多种外部表征的个性化反馈:策略配置与高中物理学习中的学习

Natalia Revenga-Lozano, Karina E. Avila, Steffen Steinert, Matthias Schweinberger, Clara E. Gómez-Pérez, Jochen Kuhn, Stefan Küchemann

机构 * Chair of Physics Education, Faculty of Physics, Ludwig-Maximilians-Universität München (LMU Munich)(物理教育系主任,物理学院,慕尼黑路易斯-马克西姆利安大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究了多种外部表征与个性化反馈在高中物理学习中的整合效果,发现详细多表征反馈对学习成绩有积极影响,且学习者根据表征能力选择不同反馈策略。

Comments Keywords: Adaptive Feedback, Multimodal Learning, Multiple External Representations, Physics Education, Science Education, Representational Competences, Intelligent Tutoring Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09578 2026-01-15 cs.RO cs.CV 74%

Multimodal Signal Processing For Thermo-Visible-Lidar Fusion In Real-time 3D Semantic Mapping

多模态信号处理用于热-可见-激光雷达融合的实时3D语义制图

Jiajun Sun, Yangyi Ou, Haoyuan Zheng, Chao yang, Yue Ma

机构 * College of Mechatronics and Control Engineering, Shenzhen University(深圳大学机械与控制工程学院) School of Robotics, Xi’an-Jiaotong Liverpool University(西安交通大学利物浦大学机器人学院)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 本文提出通过多模态信号处理融合热、可见和激光雷达数据,提升实时3D语义制图的精度与语义理解能力,适用于灾害评估和工业维护等场景。

Comments 5 pages,7 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11311 2026-01-15 eess.IV cs.AI cs.CV cs.LG 62%

Large-scale modality-invariant foundation models for brain MRI analysis: Application to lesion segmentation

大规模模态不变基础模型用于脑MRI分析:应用于病变分割

Petros Koutsouvelis, Matej Gazda, Leroy Volmer, Sina Amirrajab, Kamil Barbierik, Branislav Setlak, Jakub Gazda, Peter Drotar

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种大规模模态不变基础模型,用于提升脑MRI中病变分割的性能,通过自监督学习预训练并保留细粒度模态特定特征。

Comments Submitted to IEEE ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 1 篇

2601.09007 2026-01-15 math.ST cs.NA math.NA stat.CO stat.TH 50%

Global polynomial-time estimation in statistical nonlinear inverse problems via generalized stability

通过广义稳定性实现统计非线性反问题的全局多项式时间估计

Sven Wang

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出了一种基于广义稳定性的多项式时间估计方法,用于解决非线性反问题,实现了全局可计算性和最优统计收敛速率。

Comments 46 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏