arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-08 至 2026-01-08 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 5 篇

2504.16942 2026-01-08 cs.SI cs.AI cs.CV 62%

S2Vec: Self-Supervised Geospatial Embeddings for the Built Environment

S2Vec: 自监督的建成环境地理嵌入

Shushman Choudhury, Elad Aharoni, Chandrakumari Suvarna, Iveel Tsogsuren, Abdul Rahman Kreidieh, Chun-Ta Lu, Neha Arora

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 S2Vec通过自监督学习生成通用的地理空间嵌入,适用于建成环境特征的表示,并在社会经济任务中表现优异,同时支持多模态融合提升性能。

Journal ref ACM Transactions on Spatial Algorithms and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03490 2026-01-08 cs.CV cs.AI 62%

CroBIM-U: Uncertainty-Driven Referring Remote Sensing Image Segmentation

CroBIM-U: 基于不确定性的遥感图像分割

Yuzhe Sun, Zhe Dong, Haochen Jiang, Tianzhu Liu, Yanfeng Gu

机构 * School of Electronics and Information Engineering, Harbin Institute of Technology(电子与信息工程学院,哈尔滨工业大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 CroBIM-U通过不确定性引导框架提升遥感图像分割的鲁棒性和几何精度,采用不确定性图和即插即用模块实现自适应推理与局部细化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03460 2026-01-08 cs.CV cs.AI 62%

FROST-Drive: Scalable and Efficient End-to-End Driving with a Frozen Vision Encoder

FROST-Drive: 可扩展且高效的端到端驾驶方法,采用冻结的视觉编码器

Zeyu Dong, Yimin Zhu, Yu Wu, Yu Sun

机构 * Stony Brook University(石溪大学) Rutgers University(罗格斯大学) Sunrise Technology Inc.(Sunrise技术公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FROST-Drive通过冻结预训练视觉编码器,结合适配器和解码器,实现高效端到端驾驶,优于全微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03526 2026-01-08 cs.CV 57%

Physics-Constrained Cross-Resolution Enhancement Network for Optics-Guided Thermal UAV Image Super-Resolution

具有物理约束的跨分辨率增强网络用于光学引导的热无人机图像超分辨率

Zhicheng Zhao, Fengjiao Peng, Jinquan Yan, Wei Lu, Chenglong Li, Jin Tang

机构 * School of Artificial Intelligence, Anhui University, Hefei, 230601, China(人工智能学院,安徽大学,合肥,230601,中国) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation, Anhui University, Hefei 230601, China(安徽省多模态认知计算重点实验室,安徽大学,合肥,230601,中国) School of Computer Science and Technology, Anhui University, Hefei, 230601, China(计算机科学与技术学院,安徽大学,合肥,230601,中国)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 PCNet通过物理约束的跨分辨率增强模块和热传导模块,提升光学引导的热无人机图像超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03747 2026-01-08 cs.LG cs.CL stat.AP 57%

Context-Alignment: Activating and Enhancing LLM Capabilities in Time Series

上下文对齐:在时间序列中激活和增强大语言模型的能力

Yuxiao Hu, Qian Li, Dongxiao Zhang, Jinyue Yan, Yuntian Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Eastern Institute of Technology(东部技术研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文提出上下文对齐方法,通过多模态输入和图神经网络增强LLMs在时间序列任务中的能力,提升逻辑和结构理解,提高预测性能。

Comments This paper has been accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏