arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-30 至 2025-12-30 共收录 45 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2512.22218 2025-12-30 cs.CV cs.MM 79%

Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark

面向路牌的视觉问答:ViSignVQA数据集、方法与基准

Hieu Minh Nguyen, Tam Le-Thanh Dang, Kiet Van Nguyen

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(胡志明市信息技术大学) Vietnam National University(越南国家大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 ViSignVQA首次提出大规模越南语路牌多模态数据集,结合OCR与预训练语言模型,提升低资源语言VQA性能。

Comments Dataset paper; code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07984 2025-12-30 cs.CV 57%

View Selection for 3D Captioning via Diffusion Ranking

通过扩散排名进行3D描述生成的视图选择

Tiange Luo, Justin Johnson, Honglak Lee

机构 * University of Michigan LG AI Research(密歇根大学LG人工智能研究)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出DiffuRank方法,通过评估3D物体与2D视图的对齐度,提升3D描述生成的准确性与细节,同时扩展数据集规模并优于CLIP模型。

Comments Dataset link: https://huggingface.co/datasets/tiange/Cap3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22457 2025-12-30 cs.IR 50%

A Real-Time System to Populate FRA Form 57 from News

一种实时系统用于从新闻中填写FRA表单57

Chansong Lim, Haz Sameen Shahgir, Yue Dong, Jia Chen, Evangelos E. Papalexakis

专题命中 视觉问答 :vision language model(abstract)

AI总结 本文提出了一种实时系统,通过从新闻中提取信息来自动填写FRA表单57,解决了表单复杂性和新闻噪声问题。

Comments to be published in WSDM 2026 Demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 11 篇

2512.22183 2025-12-30 cs.CV cs.AI cs.CL 86%

Unbiased Visual Reasoning with Controlled Visual Inputs

通过受控视觉输入实现无偏视觉推理

Zhaonan Li, Shijie Lu, Fei Wang, Jacob Dineen, Xiao Ye, Zhikun Xu, Siyi Liu, Young Min Cho, Bangzheng Li, Daniel Chang, Kenny Nguyen, Qizheng Yang, Muhao Chen, Ben Zhou

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) University of Pennsylvania(宾夕法尼亚大学) University of California, Davis(加州大学戴维斯分校)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 VISTA通过解耦感知与推理,利用受控接口和强化学习训练,提升了视觉推理的鲁棒性和中立性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22275 2025-12-30 cs.CV cs.AI 81%

The Illusion of Clinical Reasoning: A Benchmark Reveals the Pervasive Gap in Vision-Language Models for Clinical Competency

临床推理的幻觉:一个基准揭示了视觉语言模型在临床能力方面的广泛差距

Dingyu Wang, Zimu Yuan, Jiajun Liu, Shanggui Liu, Nan Zhou, Tianxing Xu, Di Huang, Dong Jiang

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出B&J基准测试,揭示了视觉语言模型在临床推理任务中存在显著的多模态整合能力不足问题,强调需在多模态整合和视觉理解上取得突破才能实现临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23568 2025-12-30 cs.CV 70%

ThinkGen: Generalized Thinking for Visual Generation

ThinkGen: 用于视觉生成的通用思考

Siyu Jiao, Yiheng Lin, Yujie Zhong, Qi She, Wei Zhou, Xiaohan Lan, Zilong Huang, Fei Yu, Yingchen Yu, Yunqing Zhao, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) Bytedance Home(字节跳动)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 ThinkGen通过结合预训练的大语言模型和扩散变换器,提出了一种基于思考的视觉生成框架,实现了在多种生成任务中的高效推理和高质量图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19683 2025-12-30 cs.CV 70%

From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs

从室内到开放世界:揭示MLLMs中的空间推理差距

Mingrui Wu, Zhaozhi Wang, Fangjinhua Wang, Jiaolong Yang, Marc Pollefeys, Tong Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出了一种大规模基准测试,通过户外数据集揭示MLLMs在空间推理方面的不足,并证明其依赖语言先验而非真实视觉推理。

Comments Project page: https://mingrui-wu.github.io/openbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22226 2025-12-30 cs.CV cs.AI cs.CL cs.LG 67%

VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs

VideoScaffold: 基于弹性尺度的视觉层次结构用于多模态大语言模型中的流媒体视频理解

Naishan Zheng, Jie Huang, Qingpei Guo, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Ant Group(蚂蚁集团)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 VideoScaffold通过弹性尺度事件分割和层次事件整合,实现了流媒体视频理解中的细粒度到抽象事件推理的动态转换,提升多模态大语言模型的视频处理性能。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23545 2025-12-30 cs.CV cs.AI 62%

PathFound: An Agentic Multimodal Model Activating Evidence-seeking Pathological Diagnosis

PathFound: 一种促进证据寻求病理诊断的代理多模态模型

Shengyi Hua, Jianfeng Wu, Tianle Shen, Kangzhe Hu, Zhongzhen Huang, Shujuan Ni, Zhihong Zhang, Yuan Li, Zhe Wang, Xiaofan Zhang

机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University(上海交通大学庆元研究院) Shanghai Innovation Institute(上海创新研究院) Department of Pathology, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学学院病理科) Intelligent Pathology Institute, Division of Life Sciences and Medicine(生命科学与医学学院智能病理研究所) Department of Pathology, Fudan University Shanghai Cancer Center(复旦大学上海癌症中心病理科) Department of Oncology, Shanghai Medical College, Fudan University(复旦大学上海医学院肿瘤科) Institute of Pathology, Fudan University(复旦大学病理研究所) Department of Pathology, The First Affiliated Hospital with Nanjing Medical University(南京医科大学第一附属医院病理科)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 PathFound是一种通过主动信息获取和诊断完善来提升病理诊断准确性的代理多模态模型,其在多种临床场景中表现出卓越的诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15759 2025-12-30 cs.CL cs.AI cs.CV 62%

Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs

视觉增强大语言模型:赋能大语言模型中的多模态知识存储与共享

Yunxin Li, Zhenyu Liu, Baotian Hu, Wei Wang, Yuxin Ding, Xiaochun Cao, Min Zhang

机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MKS2方法,通过多模态知识存储与共享增强大语言模型的推理能力,提升其在物理和常识知识场景下的表现。

Comments 21 pages, 7 figures; Accepted by IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22545 2025-12-30 cs.CV cs.AI 62%

Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains

跨多模态领域自奖励的推理框架

Jesen Zhang, Ningyuan Liu, Kaitong Cai, Sidi Liu, Jing Yang, Ziliang Chen, Xiaofei Sun, Keze Wang

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 SR-MCR通过自奖励机制提升多模态推理的连贯性和准确性,在视觉基准测试中取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22315 2025-12-30 cs.CV cs.AI 62%

VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning

VideoZoomer: 用于长视频推理的强化学习时序聚焦

Yang Ding, Yizhen Zhang, Xin Lai, Ruihang Chu, Yujiu Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 VideoZoomer通过强化学习实现动态时序聚焦,提升长视频推理性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23024 2025-12-30 cs.CV 57%

With Great Context Comes Great Prediction Power: Classifying Objects via Geo-Semantic Scene Graphs

大_context带来大预测能力:通过地-语义场景图进行物体分类

Ciprian Constantinescu, Marius Leordeanu

机构 * National University of Science and Technology(科学与技术国家大学) POLITEHNICA Bucharest(布加勒斯特POLITEHNICA)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出了一种基于地-语义场景图的上下文感知物体分类框架,通过整合深度估计与全景分割模型,显著提升分类准确率至73.4%,优于传统方法和多模态大语言模型。

Comments This paper is a development of the visual riddle game with Human-AI interaction, entitled "GuessWhat - Riddle Eye with AI", developed by Ciprian Constantinescu (POLItEHNICA Bucharest), Serena Stan (Instituto Cervantes Bucarest) and Marius Leordeanu (POLITEHNICA Bucharest), which was the winner (1st place) of the NeoArt Connect NAC 2025 Scholarship Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22207 2025-12-30 cs.AI 57%

GamiBench: Evaluating Spatial Reasoning and 2D-to-3D Planning Capabilities of MLLMs with Origami Folding Tasks

GamiBench: 通过折纸任务评估多模态大语言模型的空间推理和2D到3D规划能力

Ryan Spencer, Roey Yaari, Ritvik Vemavarapu, Joyce Yang, Steven Ngo, Utkarsh Sharma

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 GamiBench通过折纸任务评估多模态大语言模型的空间推理和2D到3D规划能力,引入新指标并揭示模型在复杂折叠任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 13 篇

2512.23219 2025-12-30 cs.CV 83%

MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?

MM-UAVBench: 多模态大语言模型在低空无人机场景中的感知、推理与规划能力如何?

Shiqi Dai, Zizhi Ma, Zhicong Luo, Xuesong Yang, Yibin Huang, Wanyue Zhang, Chi Chen, Zonghao Guo, Wang Xu, Yufei Sun, Maosong Sun

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Northwest Polytechnical University(西北工业大学) Chinese Academy of Sciences(中国科学院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 MM-UAVBench通过系统评估多模态大语言模型在低空无人机场景中的感知、推理与规划能力,揭示其在复杂任务中的性能瓶颈与改进方向。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19466 2025-12-30 cs.CV cs.LG 81%

ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection

ForgerySleuth: 赋能多模态大语言模型进行图像篡改检测

Zhihao Sun, Haoran Jiang, Haoran Chen, Yixin Cao, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV、cs.LG

AI总结 ForgerySleuth通过多模态大语言模型进行图像篡改检测,利用线索融合和数据集构建提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22197 2025-12-30 cs.CV 79%

Quadrant Segmentation VLM with Few-Shot Adaptation and OCT Learning-based Explainability Methods for Diabetic Retinopathy

四象限分割视觉语言模型结合少样本适应与基于OCT学习的可解释方法用于糖尿病视网膜病变

Shivum Telang

机构 * Department of Biostatics(生物统计学系) North Allegheny Senior High School(北阿勒格尼高中) University of Pittsburgh Rangos Research Center(匹兹堡大学Rangos研究中心)

专题命中 视觉定位与Grounding :VLM(title,abstract);分类 cs.CV

AI总结 本文提出一种基于四象限分割和少样本学习的多模态视觉语言模型,利用OCT和视网膜图像生成可解释性热图,提升糖尿病视网膜病变的诊断效果。

Comments 4 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18262 2025-12-30 cs.RO cs.AI cs.CV cs.HC cs.LG 75%

ReSemAct: Advancing Fine-Grained Robotic Manipulation via Semantic Structuring and Affordance Refinement

ReSemAct:通过语义结构化和效用细化推进细粒度机器人操作

Chenyu Su, Weiwei Shang, Chen Qian, Fei Zhang, Shuang Cong

机构 * Department of Automation, University of Science and Technology of China(自动化系,中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ReSemAct 通过语义结构化和效用细化方法,在细粒度机器人操作中实现更精确的效用目标生成与动态环境适应。

Comments Code and videos: https://github.com/scy-v/ReSemAct and https://resemact.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23244 2025-12-30 cs.CV cs.AI 73%

ViLaCD-R1: A Vision-Language Framework for Semantic Change Detection in Remote Sensing

ViLaCD-R1: 一种用于遥感语义变化检测的视觉-语言框架

Xingwei Ma, Shiyang Feng, Bo Zhang, Bin Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 ViLaCD-R1通过多图像推理器和掩码引导解码器,提升遥感变化检测的语义识别与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22220 2025-12-30 cs.CV cs.AI cs.RO 62%

On Extending Semantic Abstraction for Efficient Search of Hidden Objects

关于扩展语义抽象以实现隐藏物体的高效搜索

Tasha Pais, Nikhilesh Belulkar

机构 * Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文通过扩展语义抽象,提出了一种高效搜索隐藏物体的方法,利用历史数据提升3D定位精度,帮助家庭机器人更快找到丢失物品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22129 2025-12-30 cs.MA cs.AI cs.LG 62%

ReCollab: Retrieval-Augmented LLMs for Cooperative Ad-hoc Teammate Modeling

ReCollab:基于检索增强的LLM用于协作即兴队友建模

Conor Wallace, Umer Siddique, Yongcan Cao

机构 * Department of Electrical and Computer Engineering, University of Texas at San Antonio(电子与计算机工程系,德克萨斯大学圣安东尼奥分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 ReCollab通过检索增强生成技术提升即兴团队合作中队友行为建模的适应性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23557 2025-12-30 cs.CR cs.AI 57%

Toward Trustworthy Agentic AI: A Multimodal Framework for Preventing Prompt Injection Attacks

迈向可信的代理AI:一种多模态框架用于防止提示注入攻击

Toqeer Ali Syed, Mishal Ateeq Almutairi, Mahmoud Abdel Moaty

机构 * Faculty of Computer and Information System(计算机与信息系统系) Islamic University of Madinah(麦地那伊斯兰大学) Arab Open University-Bahrain(巴林阿拉伯开放大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

AI总结 本文提出一种多模态框架,通过溯源感知机制防止代理AI中的提示注入攻击,提升系统安全性和稳定性。

Comments It is accepted in a conference paper, ICCA 2025 in Bahrain on 21 to 23 December

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22336 2025-12-30 cs.AI cs.CL 57%

Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback

Agent2World: 通过自适应多智能体反馈学习生成符号世界模型

Mengkang Hu, Bowei Xia, Yuran Wu, Ailing Yu, Yude Zou, Qiguang Chen, Shijian Wang, Jiarui Jin, Kexin Li, Wenxiang Jiao, Yuan Lu, Ping Luo

机构 * The University of Hong Kong(香港大学) Xiaohongshu Inc.(小红书公司) UESTC(电子科技大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Agent2World通过自适应多智能体反馈学习生成符号世界模型,提升推理和微调性能,实现30.95%的相对提升。

Comments 48 pages, 15 tables, 7 figures, Project page: https://agent2world.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22199 2025-12-30 cs.AI 57%

Bidirectional RAG: Safe Self-Improving Retrieval-Augmented Generation Through Multi-Stage Validation

双向RAG:通过多阶段验证实现安全的自我改进检索增强生成

Teja Chinthala

机构 * Independent Researcher(独立研究者)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 双向RAG通过多阶段验证实现安全的自我改进检索增强生成,提高了覆盖率并减少了文档数量,展示了RAG系统在严格验证下的可行性。

Comments 10 pages, 2 figures, 2 tables. 36 experiments across 4 datasets with 3 random seeds. Code available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02005 2025-12-30 cs.CV 57%

Learning Visual Affordance from Audio

从音频学习视觉可及性

Lidong Lu, Guo Chen, Zhu Wei, Yicheng Liu, Tong Lu

机构 * Nanjing University(南京大学) China Mobile Communications Company Limited Research Institute(中国移动通信有限公司研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 AVAGFormer通过融合音频和视觉信号,实现了从音频学习视觉可及性的任务,提升了交互区域的识别性能。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09614 2025-12-30 cs.CV cs.CL 57%

RAVEL: Rare Concept Generation and Editing via Graph-driven Relational Guidance

RAVEL:通过图驱动的关系引导进行罕见概念生成与编辑

Kavana Venkatesh, Yusuf Dalva, Ismini Lourentzou, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学) UIUC(伊利诺伊大学香槟分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 RAVEL通过图驱动的关系引导方法,提升罕见概念生成与编辑的可控性和可解释性,适用于长尾领域。

Comments Project Page: https://ravel-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22534 2025-12-30 cs.DC 50%

Object Abstraction To Streamline Edge-Cloud-Native Application Development

对象抽象以简化边缘-云原生应用开发

Pawissanutt Lertpongrujikorn

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究提出OaaS范式,通过整合碎片化抽象和自动化优化,简化云原生应用开发,提升生产率和可维护性。

Comments This is a doctoral dissertation submitted to University of North Texas

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 1 篇

2512.22238 2025-12-30 cs.LG cs.AI cs.CV 82%

Masking Teacher and Reinforcing Student for Distilling Vision-Language Models

掩码教师与强化学生用于蒸馏视觉-语言模型

Byung-Kwan Lee, Yu-Chiang Frank Wang, Ryo Hachiuma

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Masters通过掩码教师和强化学生的方法,解决视觉-语言模型蒸馏中的大小差距问题,提升学生模型的表示学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 4 篇

2512.23453 2025-12-30 cs.CV cs.AI 84%

CoFi-Dec: Hallucination-Resistant Decoding via Coarse-to-Fine Generative Feedback in Large Vision-Language Models

CoFi-Dec:通过粗到细的生成反馈在大视觉-语言模型中实现抗幻觉解码

Zongsheng Cao, Yangfan He, Anran Liu, Jun Xie, Feng Chen, Zepeng Wang

机构 * Researcher(研究者)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 CoFi-Dec通过粗到细的生成反馈机制,在大视觉-语言模型中减少幻觉,提升解码的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23109 2025-12-30 cs.LG cs.AI stat.ML 84%

How Much Data Is Enough? Uniform Convergence Bounds for Generative & Vision-Language Models under Low-Dimensional Structure

需要多少数据?在低维结构下生成式与视觉-语言模型的统一收敛界限

Paul M. Thompson

机构 * Stevens Institute for Neuroimaging and Informatics, University of Southern California(神经影像与信息学研究所,南加州大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 研究在低维结构下生成式和视觉-语言模型的统一收敛界限,探讨数据量与模型校准之间的关系。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏