arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-03 至 2025-12-03 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 7 篇

2512.02558 2025-12-03 cs.AI 83%

Empathy Level Prediction in Multi-Modal Scenario with Supervisory Documentation Assistance

多模态场景中基于监督文档辅助的共情水平预测

Yufei Xiao, Shangfei Wang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出一种结合视频、音频和文本信息的多模态共情预测方法,通过监督文档辅助训练提升文本特征提取,实验证明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02055 2025-12-03 cs.CV cs.AI 81%

Leveraging AI multimodal geospatial foundation models for improved near-real-time flood mapping at a global scale

利用AI多模态地理空间基础模型实现全球范围内的改进型实时洪水制图

Mirela G. Tulbure, Julio Caineta, Mark Broich, Mollie D. Gaines, Philippe Rufin, Leon-Friedrich Thomas, Hamed Alemohammad, Jan Hemmerling, Patrick Hostert

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究利用AI多模态地理空间基础模型提升全球实时洪水制图能力,通过微调TerraMind模型并对比不同配置,展示多模态数据整合在洪水检测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15272 2025-12-03 cs.CV cs.AI cs.CL 75%

CT-GLIP: 3D Grounded Language-Image Pretraining with CT Scans and Radiology Reports for Full-Body Scenarios

CT-GLIP:基于CT扫描和放射报告的3D grounded语言-图像预训练,用于全身场景

Jingyang Lin, Yingda Xia, Jianpeng Zhang, Ke Yan, Kai Cao, Le Lu, Jiebo Luo, Ling Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) University of Rochester(罗切斯特大学) Hupan Lab, \postcode 10587, \state Hangzhou, \country China(华普实验室,浙江省杭州市,中国) Department of Radiology, Shanghai Institution of Pancreatic Disease, \state Shanghai, \country China(胰腺疾病研究所放射科,上海市,中国)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 CT-GLIP通过构建细粒度CT报告对,提升3D grounded语言-图像预训练,实现更精确的跨模态对齐,从而在零样本任务中提升器官识别和肿瘤检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02972 2025-12-03 cs.CV cs.RO 74%

BEVDilation: LiDAR-Centric Multi-Modal Fusion for 3D Object Detection

BEVDilation:以LiDAR为中心的多模态融合用于3D目标检测

Guowen Zhang, Chenhang He, Liyi Chen, Lei Zhang

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

AI总结 BEVDilation提出以LiDAR为中心的多模态融合方法,通过稀疏体素扩张和语义引导BEV扩张模块提升3D目标检测性能,有效缓解深度误差带来的空间错位问题。

Comments Accept by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02715 2025-12-03 cs.CV 70%

GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding

GeoViS: 基于地理奖励的视觉搜索用于遥感视觉定位

Peirong Zhang, Yidan Zhang, Luxiao Xu, Jinliang Lin, Zonghao Guo, Fengxiang Wang, Xue Yang, Kaiwen Wei, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) National University of Defense Technology(国防科技大学) Shanghai Jiao Tong University(上海交通大学) Chongqing University(重庆大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 GeoViS通过地理奖励机制,实现了遥感影像中的细粒度视觉定位,通过逐步搜索和推理提升小目标检测精度与跨领域泛化能力。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02563 2025-12-03 eess.SP 50%

Predictive Beamforming in Low-Altitude Wireless Networks: A Cross-Attention Approach

低空无线网络中的预测波束成形:一种交叉注意力方法

Xiaotong Zhao, Yuanhao Cui, Weijie Yuan, Ziye Jia, Heng Liu, Chengwen Xing

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出一种基于交叉注意力融合机制的多模态预测波束成形方法,通过联合利用视觉和结构化传感器数据,提升动态低空无线网络中波束预测的准确性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02462 2025-12-03 eess.SP 50%

Bayesian Probability Fusion for Multi-AP Collaborative Sensing in Mobile Networks

基于贝叶斯概率融合的多接入点协同感知移动网络

Shengheng Liu, Xingkang Li, Yongming Huang, Yuan Fang, Qingji Jiang, Dazhuan Xu, Ziguo Zhong, Dongming Wang, Xiaohu You

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出基于贝叶斯概率融合的多接入点协同感知框架,通过正交频分复用波形实现目标参数估计,提升通信效率与感知精度。

Comments 16 pages, 10 figures, submitted to Science China Information Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏