arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-11 至 2025-12-11 共收录 35 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 6 篇

2512.09573 2025-12-11 cs.CV 57%

Investigate the Low-level Visual Perception in Vision-Language based Image Quality Assessment

研究基于视觉-语言的图像质量评估中的低级视觉感知

Yuan Li, Zitang Sun, Yen-Ju Chen, Shin'ya Nishida

机构 * Graduate School of Informatics, Kyoto University(京都大学信息科学研究生院)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 本文研究了基于视觉-语言模型的图像质量评估中低级视觉感知的问题,发现现有模型在检测基本失真时存在偏差,并通过改进视觉编码器对齐度提升失真识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09148 2025-12-11 cs.CL cs.AI 57%

Detecting Hallucinations in Graph Retrieval-Augmented Generation via Attention Patterns and Semantic Alignment

通过注意力模式和语义对齐检测图检索增强生成中的幻觉

Shanghao Li, Jinda Han, Yibo Wang, Yuanjie Zhu, Zihe Song, Langzhou He, Kenan Kamel A Alghythee, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出通过注意力模式和语义对齐检测GraphRAG中的幻觉,开发了轻量级检测器GGA,提升了系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02603 2025-12-11 eess.AS cs.CL cs.SD 50%

SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation

SEAL:用于带有检索增强生成的语音大语言模型的语音嵌入对齐学习

Chunyu Sun, Bingyu Liu, Zhichao Cui, Junhan Shi, Anbin Qi, Tian-hao Zhang, Dinghao Zhou, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 SEAL通过统一的语音和文本嵌入框架,提升语音大语言模型的检索效率与准确性,减少延迟并增强多模态检索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 2 篇

2411.14499 2025-12-11 cs.CL cs.AI cs.LG 62%

Understanding World or Predicting Future? A Comprehensive Survey of World Models

理解世界还是预测未来?世界模型的全面综述

Jingtao Ding, Yunke Zhang, Yu Shang, Jie Feng, Yuheng Zhang, Zefang Zong, Yuan Yuan, Hongyuan Su, Nian Li, Jinghua Piao, Yucheng Deng, Nicholas Sukiennik, Chen Gao, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(电子工程系,信息科学与技术国家研究中心(BNRist),清华大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了世界模型在理解与预测方面的功能,探讨了其在多个领域的应用及未来研究方向。

Comments Extended version of the original ACM CSUR paper, 49 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09670 2025-12-11 cs.CV cs.SY eess.SY 57%

An Automated Tip-and-Cue Framework for Optimized Satellite Tasking and Visual Intelligence

一种自动化提示与提示框架用于优化卫星任务分配和视觉智能

Gil Weissman, Amir Ivry, Israel Cohen

机构 * Andrew and Erna Viterbi Faculty of Electrical and Computer Engineering, Technion-Israel Institute of Technology(安德鲁和伊尔纳·维特比电气与计算机工程学院,技术离子理工学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种自动化提示与提示框架,用于优化卫星任务分配和视觉智能,通过生成提示和任务并利用人工智能模型处理影像,提升地球观测效率。

Comments Under review at IEEE Transactions on Geoscience and Remote Sensing (TGRS). 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏