arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-10 至 2025-12-10 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 5 篇

2512.08889 2025-12-10 cs.CV cs.AI 76%

No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers

无标签,无问题:利用多模态验证器训练视觉推理器

Damiano Marsili, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI

AI总结 本文提出无需标注的视觉推理训练框架,结合AI驱动的验证器提升推理与定位能力,超越现有开源和专有模型。

Comments Project webpage: https://glab-caltech.github.io/valor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08567 2025-12-10 cs.LG cs.AI 57%

A Hybrid Model for Stock Market Forecasting: Integrating News Sentiment and Time Series Data with Graph Neural Networks

一种股票市场预测的混合模型:整合新闻情感与时间序列数据与图神经网络

Nader Sadek, Mirette Moawad, Christina Naguib, Mariam Elzahaby

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种结合新闻情感与时间序列数据的混合模型,利用图神经网络提升股票市场预测性能,实验显示GNN在准确率和精度上均优于LSTM基线。

Comments 11 pages, 6 figures. Published in the Proceedings of the 5th International Conference on Artificial Intelligence Research (ICAIR 2025). Published version available at: https://papers.academic-conferences.org/index.php/icair/article/view/4294

Journal ref Proceedings of the 5th International Conference on AI Research (ICAIR 2025), Vol. 5, No. 1, pp. 452-462 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08262 2025-12-10 cs.CV cs.RO 57%

RLCNet: An end-to-end deep learning framework for simultaneous online calibration of LiDAR, RADAR, and Camera

RLCNet: 一种用于同时在线校准激光雷达、雷达和摄像头的端到端深度学习框架

Hafeez Husain Cholakkal, Stefano Arrigoni, Francesco Braghin

机构 * Department of Mechanical Engineering, Politecnico di Milano(机械工程系,米兰理工学院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 RLCNet通过端到端深度学习框架实现激光雷达、雷达和摄像头的同时在线校准,提升自动驾驶系统在动态环境中的感知可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08221 2025-12-10 cs.CV 57%

VisKnow: Constructing Visual Knowledge Base for Object Understanding

VisKnow: 构建视觉知识库以实现物体理解

Ziwei Yao, Qiyang Wan, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室、计算技术研究所)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 VisKnow通过构建视觉知识库,利用多模态数据提升物体理解能力,包含AnimalKB案例研究,用于零样本识别和知识图谱完成等任务。

Comments 16 pages, 12 figures, 7 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08316 2025-12-10 astro-ph.IM astro-ph.CO 50%

PolySwyft: sequential simulation-based nested sampling

PolySwyft:基于序列模拟的嵌套采样

Kilian H. Scheutwinkel, Will Handley, Christoph Weniger, Eloy de Lera Acedo

专题命中 其他多模态 :multimodal(abstract)

AI总结 PolySwyft结合嵌套采样和神经比率估计,通过序列模拟方法高效推断复杂后验分布,适用于似然不可行但正向模拟器可用的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏