arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-16 至 2026-01-16 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6 篇

2601.10092 2026-01-16 cs.LG cs.AI 79%

LeMoF: Level-guided Multimodal Fusion for Heterogeneous Clinical Data

LeMoF:面向异构临床数据的层级引导多模态融合

Jongseok Kim, Seongae Kang, Jonghwan Shin, Yuhan Lee, Ohyun Jo

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 LeMoF通过层级引导的多模态融合方法,在异构临床数据中提升预测稳定性与判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07266 2026-01-16 cs.CV 57%

RS2-SAM2: Customized SAM2 for Referring Remote Sensing Image Segmentation

RS2-SAM2:为指向遥感图像分割定制的SAM2

Fu Rong, Meng Lan, Qian Zhang, Lefei Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 RS2-SAM2通过结合遥感特征和文本特征,改进SAM2以实现更精确的遥感图像分割。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09859 2026-01-16 cs.CV cs.LG 57%

Breaking the Limits of Open-Weight CLIP: An Optimization Framework for Self-supervised Fine-tuning of CLIP

突破开放权重CLIP的限制:一种用于CLIP自监督微调的优化框架

Anant Mehta, Xiyuan Wei, Xingyu Chen, Tianbao Yang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 TuneCLIP通过自监督微调框架提升开放权重CLIP模型在多种下游任务上的性能,实现显著的性能提升。

Comments Submitted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09812 2026-01-16 cs.CV cs.RO 57%

LCF3D: A Robust and Real-Time Late-Cascade Fusion Framework for 3D Object Detection in Autonomous Driving

LCF3D: 一种用于自动驾驶中3D物体检测的鲁棒且实时的后期级联融合框架

Carlo Sgaravatti, Riccardo Pieroni, Matteo Corno, Sergio M. Savaresi, Luca Magri, Giacomo Boracchi

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 LCF3D通过结合RGB图像和LiDAR点云的后期级联融合方法,提升自动驾驶中3D物体检测的鲁棒性和实时性。

Comments 35 pages, 14 figures. Published at Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25677 2026-01-16 cs.CR cs.CL 57%

ZK-SenseLM: Verifiable Large-Model Wireless Sensing with Selective Abstention and Zero-Knowledge Attestation

ZK-SenseLM:基于选择性回避和零知识证明的可验证大模型无线传感

Hasan Akgul, Mari Eplik, Javier Rojas, Aina Binti Abdullah, Pieter van der Merwe

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL

AI总结 ZK-SenseLM通过选择性回避和零知识证明提升无线传感的安全性和可验证性,实现高精度和鲁棒性。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10412 2026-01-16 eess.IV 50%

An effective interactive brain cytoarchitectonic parcellation framework using pretrained foundation model

一种利用预训练基础模型的有效交互式脑皮层分区框架

Shiqi Zhang, Fang Xu, Pengcheng Zhou

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出一种利用预训练基础模型的交互式脑皮层分区框架,通过多层特征融合和轻量级解码器实现高效分割,提升大规模数据集的分割精度。

Comments 10 pages, 5 figures, Accepted at IMIP2026 Code: https://github.com/Confetti22/cytoarch_brain_parcellation_dino

详情

展开后加载摘要…

URL PDF HTML 收藏