arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2507.02190 2025-12-23 cs.RO cs.LG 57%

cVLA: Towards Efficient Camera-Space VLAs

cVLA:迈向高效的相机空间VLA

Max Argus, Jelena Bratulic, Houman Masnavi, Maxim Velikanov, Nick Heppert, Abhinav Valada, Thomas Brox

机构 * University of Freiburg(弗赖堡大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.LG

AI总结 cVLA通过利用视觉语言模型在2D图像上的性能,提出了一种高效预测机器人轨迹的VLA方法,具备良好的仿真到现实迁移能力。

Comments 20 pages, 10 figures; CoRL 2025 Workshop on Generalizable Priors for Robot Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13274 2025-12-23 cs.LG cs.CL 57%

AdaLRS: Loss-Guided Adaptive Learning Rate Search for Efficient Foundation Model Pretraining

AdaLRS: 基于损失的自适应学习率搜索用于高效基础模型预训练

Hongyuan Dong, Dingkang Yang, Xiao Liang, Chao Feng, Jiao Ran

机构 * ByteDance Inc.(字节跳动公司)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

AI总结 AdaLRS通过优化损失下降速度实现高效基础模型预训练,无需大量超参数调优,显著提升模型性能和鲁棒性。

Comments NeurIPS 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17189 2025-12-22 cs.CV 57%

Anatomical Region-Guided Contrastive Decoding: A Plug-and-Play Strategy for Mitigating Hallucinations in Medical VLMs

解剖区域引导的对比解码:一种用于缓解医学视觉-语言模型幻觉的即插即用策略

Xiao Liang, Chenxi Liu, Zhi Ma, Di Wang, Bin Jing, Quan Wang, Yuanyuan Shi

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了解剖区域引导的对比解码策略,通过区域特定指导缓解医学视觉-语言模型的幻觉问题,提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17121 2025-12-22 cs.LG 57%

The Effect of Negation on CLIP in Medical Imaging: Limitations of Contrastive Language-Image Pretraining

否定对CLIP在医学影像中的影响:对比语言-图像预训练的局限性

Jasmine Vu, Shivanand Sheshappanavar

机构 * Santa Clara University(圣克拉拉大学) University of Wyoming(怀俄明大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 研究探讨CLIP在医学影像中处理否定短语的局限性,并通过调优方法提升其检索准确性与可靠性。

Comments 10 pages, 7 figures, submitted to WACV Pixels to Patients Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20322 2025-12-19 cs.CV 57%

HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models

HyperET: 在超几何空间中为多模态大语言模型实现高效训练

Zelin Peng, Zhengqin Xu, Qingyang Liu, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, SJTU(摩埃人工智能重点实验室、人工智能学院、计算机科学学院、上海交通大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 HyperET通过在双曲空间中动态调整半径,实现多模态大语言模型的高效训练,提升跨模态对齐性能。

Comments Accepted by NeurIPS2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15531 2025-12-18 cs.CV 57%

An Efficient and Effective Encoder Model for Vision and Language Tasks in the Remote Sensing Domain

一种用于遥感领域的高效且有效的编码器模型

João Daniel Silva, Joao Magalhaes, Devis Tuia, Bruno Martins

机构 * INESC-ID, Instituto Superior Técnico, University of Lisbon(INESC-ID,理工学院,里斯本大学) Department of Computer Science, Faculty of Science and Technology, Universidade NOVA de Lisboa(计算机科学系,科学与技术学院,诺瓦大学) School of Architecture, Civil and Environmental Engineering, EPFL(建筑、土木和环境工程学院,EPFL)

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出了一种高效且紧凑的编码器模型,用于处理遥感领域的多任务学习,包括图像文本生成和跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13072 2025-12-16 cs.CV 57%

Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models

锻造动态记忆:基于检索的持续学习用于通用医学基础模型

Zizhi Chen, Yizhen Gao, Minghao Han, Yizhou Liu, Zhaoyu Chen, Dingkang Yang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(Fysics智能技术有限公司(Fysics AI)) School of Computer Science and Engineering(计算机科学与工程学院) Central South University(中南大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于检索的持续学习方法,通过动态知识蒸馏和RAG技术,解决多模态医学模型在领域迁移和细粒度特征保留中的核心难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12503 2025-12-16 cs.AI 57%

KidsArtBench: Multi-Dimensional Children's Art Evaluation with Attribute-Aware MLLMs

KidsArtBench: 多维度儿童艺术评估与属性感知的大语言模型

Mingrui Ye, Chanjin Zheng, Zengyi Yu, Chenyu Xiang, Zhixue Zhao, Zheng Yuan, Helen Yannakoudakis

机构 * King’s College London(伦敦国王学院) East China Normal University(东华大学) University of Sheffield(谢菲尔德大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 KidsArtBench通过属性感知的多LoRA方法提升儿童艺术评估的准确性与教育意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07128 2025-12-16 cs.CV 57%

MulCLIP: A Multi-level Alignment Framework for Enhancing Fine-grained Long-context CLIP

MulCLIP: 一种多级对齐框架,用于增强细粒度长上下文CLIP

Chau Truong, Hieu Ta Quang, Dung D. Le

机构 * FPT Software AI Center(FPT软件人工智能中心) VinUniversity(文大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 MulCLIP通过多级对齐框架提升细粒度长上下文CLIP的性能,采用标记重建和子描述聚合策略增强语义连接与上下文提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11187 2025-12-16 cs.CV 57%

FastVID: Dynamic Density Pruning for Fast Video Large Language Models

FastVID: 动态密度修剪用于快速视频大语言模型

Leqi Shen, Guoqiang Gong, Tao He, Yifeng Zhang, Pengzhang Liu, Sicheng Zhao, Guiguang Ding

机构 * School of Software, Tsinghua University(清华大学软件学院) BNRist, Tsinghua University(清华大学BNRist) GRG Banking Equipment Co., Ltd.(GRG银行设备有限公司)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 FastVID通过动态密度修剪技术,显著降低视频大语言模型的计算开销,同时保持高准确性,实现高效的视频处理性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11251 2025-12-15 cs.LG 57%

Insight Miner: A Time Series Analysis Dataset for Cross-Domain Alignment with Natural Language

Insight Miner: 一个用于跨领域对齐的时间序列分析数据集与自然语言

Yunkai Zhang, Yawen Zhang, Ming Zheng, Kezhen Chen, Chongyang Gao, Ruian Ge, Siyuan Teng, Amine Jelloul, Jinmeng Rao, Xiaoyuan Guo, Chiang-Wei Fang, Zeyu Zheng, Jie Yang

机构 * UC Berkeley(加州大学伯克利分校) Mineral(矿石) Northwestern University(西北大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.LG

AI总结 Insight Miner 是一个大规模多模态模型,通过代理工作流生成高质量时间序列描述,提升跨领域时间序列分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10750 2025-12-12 cs.CV 57%

LDP: Parameter-Efficient Fine-Tuning of Multimodal LLM for Medical Report Generation

LDP:多模态大语言模型在医疗报告生成中的参数高效微调

Tianyu Zhou, Junyi Tang, Zehui Li, Dahong Qian, Suncheng Xiang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 LDP通过多模态大语言模型和参数高效微调技术,提升结肠镜息肉诊断报告的准确性和效率,显著降低训练成本并获得专家评分。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09872 2025-12-11 cs.CR cs.AI 57%

FlipLLM: Efficient Bit-Flip Attacks on Multimodal LLMs using Reinforcement Learning

FlipLLM: 通过强化学习高效攻击多模态大语言模型的位翻转攻击

Khurram Khalil, Khaza Anuarul Hoque

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) University of Missouri-Columbia(密苏里大学哥伦比亚分校)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.AI

AI总结 FlipLLM通过强化学习高效识别多模态大语言模型的位翻转攻击漏洞,显著提升攻击检测速度和防御指导价值。

Comments Accepted in IEEE HOST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09663 2025-12-11 cs.CV 57%

IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting

IF-Bench:基于生成视觉提示的多模态大语言模型在红外图像上的基准测试与增强

Tao Zhang, Yuyang Hong, Yang Xia, Kun Ding, Zeyu Zhang, Ying Wang, Shiming Xiang, Chunhong Pan

机构 * MAIS, Institute of Automation(自动化研究所信息处理中心) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Research Center of Aerospace Information, Institute of Automation(自动化研究所航空信息研究中心)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 IF-Bench通过生成视觉提示方法提升多模态大语言模型对红外图像的理解能力,提供首个高质量基准测试及实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09573 2025-12-11 cs.CV 57%

Investigate the Low-level Visual Perception in Vision-Language based Image Quality Assessment

研究基于视觉-语言的图像质量评估中的低级视觉感知

Yuan Li, Zitang Sun, Yen-Ju Chen, Shin'ya Nishida

机构 * Graduate School of Informatics, Kyoto University(京都大学信息科学研究生院)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 本文研究了基于视觉-语言模型的图像质量评估中低级视觉感知的问题,发现现有模型在检测基本失真时存在偏差,并通过改进视觉编码器对齐度提升失真识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09148 2025-12-11 cs.CL cs.AI 57%

Detecting Hallucinations in Graph Retrieval-Augmented Generation via Attention Patterns and Semantic Alignment

通过注意力模式和语义对齐检测图检索增强生成中的幻觉

Shanghao Li, Jinda Han, Yibo Wang, Yuanjie Zhu, Zihe Song, Langzhou He, Kenan Kamel A Alghythee, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出通过注意力模式和语义对齐检测GraphRAG中的幻觉,开发了轻量级检测器GGA,提升了系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08627 2025-12-10 cs.CV 57%

Trajectory Densification and Depth from Perspective-based Blur

轨迹密集化与基于视角的模糊深度估计

Tianchen Qiu, Qirun Zhang, Jiajian He, Zhengyue Zhuge, Jiahui Xu, Yueting Chen

机构 * College of Optical Science and Engineering(光学科学与工程学院) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种基于视角模糊和密集轨迹的深度估计方法,利用视觉-语言模型和光学设计算法实现大范围深度的高精度重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08524 2025-12-10 cs.CV cs.CL 57%

Beyond Real Weights: Hypercomplex Representations for Stable Quantization

超越真实权重:用于稳定量化 的超复数表示

Jawad Ibn Ahad, Maisha Rahman, Amrijit Biswas, Muhammad Rafsan Kabir, Robin Krambroeckers, Sifat Momen, Nabeel Mohammed, Shafin Rahman

机构 * Artificial Intelligence Department, RobotBulls Labs(机器人bulls实验室人工智能部门) Machine Intelligence Lab (MILab), North South University(北南大学机器智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种基于超复数乘法的渐进式重新参数化策略,用于压缩多模态语言模型,实现参数和计算量的显著减少,同时保持模型性能。

Comments Accepted in Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07871 2025-12-10 cs.CV 57%

CATP: Contextually Adaptive Token Pruning for Efficient and Enhanced Multimodal In-Context Learning

CATP:面向高效增强多模态上下文学习的上下文自适应令牌剪枝

Yanshu Li, Jianjiang Yang, Zhennan Shen, Ligong Han, Haoyan Xu, Ruixiang Tang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CATP通过上下文自适应令牌剪枝方法,提升多模态上下文学习的效率和性能,减少冗余令牌带来的影响。

Comments 14 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07273 2025-12-09 cs.CV 57%

RVLF: A Reinforcing Vision-Language Framework for Gloss-Free Sign Language Translation

RVLF:一种无需 gloss 的视觉-语言框架用于手语翻译

Zhi Rao, Yucheng Zhou, Benjia Zhou, Yiqing Huang, Sergio Escalera, Jun Wan

机构 * Macau University of Science and Technology(澳门科学技术大学) SKL-IOTSC, CIS, University of Macau(澳门大学智能物联网与通信系统研究所) Beijing Institute of Technology, Zhuhai(珠海北京理工大学) University of Barcelona(巴塞罗那大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 RVLF提出了一种无需gloss的手语翻译框架,通过融合骨架运动与视觉特征并结合强化学习优化,提升了翻译质量与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06999 2025-12-09 cs.SD cs.AI 57%

Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model

基于多模态大基础模型的歌唱音色受欢迎程度评估

Zihao Wang, Ruibin Yuan, Ziqi Geng, Hengjia Li, Xingwei Qu, Xinyi Li, Songye Chen, Haoying Fu, Roger B. Dannenberg, Kejun Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of California, Berkeley(加州大学伯克利分校) University of Manchester(曼彻斯特大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出基于多模态大基础模型的歌唱音色受欢迎程度评估方法,通过引入Sing-MD数据集、VocalVerse架构和H-TPR基准,实现无参考、多维度的歌唱评估。

Comments Accepted to ACMMM 2025 oral

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACMMM 2025), Pages 12227-12236

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06662 2025-12-09 cs.CV 57%

Personalized Image Descriptions from Attention Sequences

基于注意力序列的个性化图像描述

Ruoyu Xue, Hieu Le, Jingyi Xu, Sounak Mondal, Abe Leite, Gregory Zelinsky, Minh Hoai, Dimitris Samaras

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校) The University of Adelaide(阿德莱德大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 DEPER通过建模个性化注意力序列,实现了基于视觉-语言模型的个性化图像描述生成,提升了描述质量与人类对齐性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05740 2025-12-08 cs.CV 57%

Distilling Expert Surgical Knowledge: How to train local surgical VLMs for anatomy explanation in Complete Mesocolic Excision

萃取专家手术知识:如何训练局部手术VLMs用于完全网膜切除术的解剖解释

Lennart Maack, Julia-Kristin Graß, Lisa-Marie Toscha, Nathaniel Melling, Alexander Schlaefer

机构 * 1 Institute of Medical Technology Intelligent Systems, Hamburg University of Technology, Hamburg, Germany 2 Department of General, Visceral Thoracic Surgery, University Medical Center Hamburg-Eppendorf, Hamburg, Germany

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出一种隐私保护框架,通过从大型通用LLM中萃取知识,训练出高效的本地手术VLM,用于在完全网膜切除术中进行解剖解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00887 2025-12-04 cs.CV 57%

Multilingual Training-Free Remote Sensing Image Captioning

多语言免训练 遥感图像描述生成

Carlos Rebelo, Gil Rocha, João Daniel Silva, Bruno Martins

机构 * INESC-ID(葡萄牙里斯本INESC-ID研究所) Instituto Superior Técnico(葡萄牙里斯本技术大学) Faculdade de Engenharia da Universidade do Porto(葡萄牙波尔图大学工程学院)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的多语言遥感图像描述生成方法,通过检索增强提示和图基重新排序策略,实现跨语言的高效描述生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00425 2025-12-02 cs.CV 57%

What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards

视频生成中重力的作用:基于可验证奖励的后训练牛顿定律

Minh-Quan Le, Yuanzhi Zhu, Vicky Kalogeiton, Dimitris Samaras

机构 * Stony Brook University(石溪大学) LIX, École Polytechnique, CNRS, IPP(巴黎政治学院LIX研究所、法国国家科学研究中心、IPPP)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 NewtonRewards通过可验证奖励机制提升视频生成的物理合理性与运动流畅度。

Comments Project page: https://cvlab-stonybrook.github.io/NewtonRewards

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07710 2025-12-02 cs.CV cs.MM 57%

Cross Modal Fine-Grained Alignment via Granularity-Aware and Region-Uncertain Modeling

跨模态细粒度对齐 via 粒度感知和区域不确定建模

Jiale Liu, Haoming Zhou, Yishu Liu, Bingzhi Chen, Yuncheng Jiang

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出了一种基于粒度感知和区域不确定建模的跨模态细粒度对齐方法,通过显著性感知和不确定性建模提升对齐的鲁棒性和可解释性。

Comments 10 pages, 6 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23469 2025-12-01 cs.CV 57%

Visual Generation Tuning

视觉生成微调

Jiahao Guo, Sinan Du, Jingfeng Yao, Wenyu Liu, Bo Li, Haoxiang Cao, Kun Gai, Chun Yuan, Kai Wu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) School of Artificial Intelligence, South China Normal University(华南师范大学人工智能学院) Kolors Team, Kuaishou Technology(快手科技Kolors团队)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 本文提出VGT,通过视觉生成微调提升视觉语言模型的视觉生成能力,在图像重建和生成任务中均取得优异成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22897 2025-12-01 cs.CV 57%

From Points to Clouds: Learning Robust Semantic Distributions for Multi-modal Prompts

从点到云:学习多模态提示的稳健语义分布

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Xin Liu, Zhenbo Li

机构 * China Agricultural University(中国农业大学)

专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV

AI总结 本文提出P2C框架,通过动态去噪机制学习语义云分布,提升多模态提示学习的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12465 2025-12-01 cs.CV 57%

PhysX-3D: Physical-Grounded 3D Asset Generation

PhysX-3D:基于物理的3D资产生成

Ziang Cao, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 PhysX-3D提出一种基于物理的3D资产生成方法,通过构建物理标注数据集和双分支框架,提升生成资产的物理合理性和几何质量。

Comments Accepted by NeurIPS 2025, Spotlight Project page: https://physx-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04182 2025-12-01 cs.CL cs.AI 57%

COPO: Causal-Oriented Policy Optimization for Hallucinations of MLLMs

COPO:面向MLLM幻觉的因果导向策略优化

Peizheng Guo, Jingyao Wang, Wenwen Qiang, Jiahuan Zhou, Changwen Zheng, Gang Hua

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Amazon.com, Inc.(亚马逊公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 COPO通过引入因果完整性奖励和GRPO框架,解决多模态大语言模型的幻觉问题,通过令牌级因果约束确保输出的正确性和证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏