arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-03 至 2025-12-03 共收录 39 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2511.22154 2025-12-03 cs.AI 79%

WearVQA: A Visual Question Answering Benchmark for Wearables in Egocentric Authentic Real-world scenarios

WearVQA: 一个用于评估智能眼镜等可穿戴设备上多模型AI助手视觉问答能力的基准测试

Eun Chang, Zhuangqun Huang, Yiwei Liao, Sagar Ravi Bhavsar, Amogh Param, Tammy Stark, Adel Ahmadyan, Xiao Yang, Jiaqi Wang, Ahsan Abdullah, Giang Nguyen, Akil Iyer, David Hall, Elissa Li, Shane Moon, Nicolas Scheffer, Kirmani Ahmed, Babak Damavandi, Rakesh Wanga, Anuj Kumar, Rohit Patel, Xin Luna Dong

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

AI总结 WearVQA是一个评估可穿戴设备上多模型AI助手视觉问答能力的基准测试,通过真实场景下的图像-问题-答案三元组,评估其在复杂视觉输入和现实任务中的表现。

Comments 11 pages, 5 figures, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11275 2025-12-03 cs.MM cs.AI cs.CY 70%

TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs

TCC-Bench:评估多模态大语言模型对传统中国文化理解能力的基准测试

Pengju Xu, Yan Wang, Shuyuan Zhang, Xuan Zhou, Xin Li, Yue Yuan, Fengzhao Li, Shunyuan Zhou, Xingyu Wang, Yi Zhang, Haiying Zhao

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 TCC-Bench通过双语视觉问答基准评估多模态大语言模型对传统中国文化理解能力,揭示其在文化相关视觉内容推理上的挑战。

Comments There are issues with the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02485 2025-12-03 cs.CV cs.AI 62%

UCAgents: Unidirectional Convergence for Visual Evidence Anchored Multi-Agent Medical Decision-Making

UCAgents: 视觉证据锚定的多智能体医学决策收敛

Qianhan Feng, Zhongzhen Huang, Yakun Zhu, Xiaofan Zhang, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 UCAgents通过结构化证据审计和单向收敛机制,在医疗视觉问答中提升准确率并降低计算成本,平衡视觉证据揭示与文本干扰避免。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03079 2025-12-03 cs.CV 57%

Bias Beyond Demographics: Probing Decision Boundaries in Black-Box LVLMs via Counterfactual VQA

偏见超越人口统计:通过反事实视觉问答探测黑盒大视觉-语言模型的决策边界

Zaiying Zhao, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 本文通过反事实VQA基准探测黑盒LVLMs的决策边界,揭示非人口属性对决策的更大影响,并展示人类规范验证示例对提升模型响应一致性和公平性的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05332 2025-12-03 cs.CV cs.CL 57%

Unleashing Hour-Scale Video Training for Long Video-Language Understanding

释放小时级视频训练以实现长视频-语言理解

Jingyang Lin, Jialian Wu, Ximeng Sun, Ze Wang, Jiang Liu, Yusheng Su, Xiaodong Yu, Hao Chen, Jiebo Luo, Zicheng Liu, Emad Barsoum

专题命中 视觉问答 :LLaVA(abstract);分类 cs.CV

AI总结 本文提出VideoMarathon数据集和Hour-LLaVA模型,通过小时级视频训练提升长视频-语言理解能力。

Comments NeurIPS 2025, Project page: https://videomarathon.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 5 篇

2508.15690 2025-12-03 cs.AI cs.LG cs.MM 81%

GRAFT: GRaPH and Table Reasoning for Textual Alignment -- A Benchmark for Structured Instruction Following and Visual Reasoning

GRAFT:用于文本对齐的图和表推理——一个结构化指令遵循和视觉推理的基准

Abhigya Verma, Sriram Puttagunta, Seganrasan Subramanian, Sravan Ramachandran

机构 * ServiceNow

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 GRAFT基准通过结构化图表和表格及多步骤问题,评估大语言模型在视觉文本对齐、指令遵循和视觉推理方面的综合能力。

Comments 25 pages, 10 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02340 2025-12-03 cs.AI cs.CV 73%

Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective

多视角视觉空间推理的推理路径与潜在状态分析:从认知科学视角

Qiyao Xue, Weichen Liu, Shiqi Wang, Haoming Wang, Yuyang Wu, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 ReMindView-Bench从认知科学视角评估VLMs在多视角空间推理中的表现,揭示其在跨视角对齐和视角取向方面的不足。

Comments 23 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01830 2025-12-03 cs.CV 70%

OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic

OpenREAD: 基于LLM作为批评者的开放性推理端到端自动驾驶框架

Songyan Zhang, Wenhui Huang, Zhan Chen, Chua Jiahao Collister, Qihang Huang, Chen Lv

机构 * Nanyang Technological University, Singapore(南洋理工大学) Harvard University, USA(哈佛大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 OpenREAD通过端到端强化微调框架,结合LLM作为批评者,提升自动驾驶中的推理与规划能力,实现从高层推理到低层轨迹规划的全面优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02942 2025-12-03 cs.CV cs.AI 62%

Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench

基于视频科学基准的视频生成科学理解与推理评估

Lanxiang Hu, Abhilash Shankarampeta, Yixin Huang, Zilin Dai, Haoyang Yu, Yujie Zhao, Haoqiang Kang, Daniel Zhao, Tajana Rosing, Hao Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 VideoScience-Bench是首个评估视频模型科学理解和推理能力的基准测试,通过200个精心设计的提示评估模型在物理和化学领域的科学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02699 2025-12-03 cs.AI 57%

Learning What to Attend First: Modality-Importance-Guided Reasoning for Reliable Multimodal Emotion Understanding

学习优先关注什么:模态重要性引导的推理用于可靠的多模态情感理解

Hyeongseop Rha, Jeong Hun Yeo, Junil Won, Se Jin Park, Yong Man Ro

机构 * Integrated Vision and Language Lab, KAIST, South Korea(韩国成均馆大学集成视觉与语言实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出MIGR框架,通过模态重要性引导推理,提升多模态情感理解的可靠性,实验表明能有效减少情感不一致的解释实例。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 12 篇

2512.02715 2025-12-03 cs.CV 83%

GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding

GeoViS: 基于地理奖励的视觉搜索用于遥感视觉定位

Peirong Zhang, Yidan Zhang, Luxiao Xu, Jinliang Lin, Zonghao Guo, Fengxiang Wang, Xue Yang, Kaiwen Wei, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) National University of Defense Technology(国防科技大学) Shanghai Jiao Tong University(上海交通大学) Chongqing University(重庆大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 GeoViS通过地理奖励机制,实现了遥感影像中的细粒度视觉定位,通过逐步搜索和推理提升小目标检测精度与跨领域泛化能力。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06996 2025-12-03 cs.CV cs.AI 81%

Visible Yet Unreadable: A Systematic Blind Spot of Vision Language Models Across Writing Systems

可见却不可读:跨书写系统下视觉语言模型的系统性盲区

Jie Zhang, Ting Xu, Gelei Deng, Runyi Hu, Han Qiu, Tianwei Zhang, Qing Guo, Ivor Tsang

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了视觉语言模型在跨书写系统下识别碎片化文本的鲁棒性,发现其在可见但不可读的刺激下表现下降,揭示了模型对组成先验依赖不足的结构性限制。

Comments arXiv admin note: This article has been withdrawn by arXiv administrators due to violation of arXiv policy regarding generative AI authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02835 2025-12-03 cs.CV cs.AI cs.CL 73%

ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning

ReVSeg:通过强化学习激励视频分割的推理链

Yifan Li, Yingda Yin, Lingting Zhu, Weikai Chen, Shengju Qian, Xin Wang, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) LIGHTSPEED

专题命中 视觉定位与Grounding :vision language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 ReVSeg通过强化学习优化视频分割的多步推理链,实现可解释的推理轨迹和先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02731 2025-12-03 cs.AI cs.LG 62%

Self-Improving AI Agents through Self-Play

通过自play实现自我改进的AI代理

Przemyslaw Chojecki

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种通过自play实现自我改进的AI代理框架,通过GVU算子和方差不等式理论,统一了语言自play、自我修正和合成数据 bootstrap 的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26004 2025-12-03 cs.CV cs.AI 62%

Learning Egocentric In-Hand Object Segmentation through Weak Supervision from Human Narrations

通过人类叙述的弱监督学习进行视角注视手部物体分割

Nicola Messina, Rosario Leonardi, Luca Ciampi, Fabio Carrara, Giovanni Maria Farinella, Fabrizio Falchi, Antonino Furnari

机构 * Institute of Information Science and Technologies - National Research Council(信息科学与技术研究所-国家研究理事会) University of Catania(卡塔尼亚大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出WISH模型,通过人类叙述的弱监督学习实现手部物体分割,无需精细像素标注即可超越基线方法。

Comments Under consideration at Pattern Recognition Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02472 2025-12-03 cs.AI cs.CL cs.LG 62%

Guided Self-Evolving LLMs with Minimal Human Supervision

受最小人类监督引导的自演化大语言模型

Wenhao Yu, Zhenwen Liang, Chengsong Huang, Kishan Panaganti, Tianqing Fang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab in Seattle(西雅图腾讯AI实验室) Washington University in St. Louis(斯托克维尔华盛顿大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 R-Few通过引入轻量级人类监督,实现稳定可控的自演化大语言模型,提升数学推理性能并减少对大量人类数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03041 2025-12-03 cs.CV 57%

MultiShotMaster: A Controllable Multi-Shot Video Generation Framework

MultiShotMaster: 一种可控的多镜头视频生成框架

Qinghe Wang, Xiaoyu Shi, Baolu Li, Weikang Bian, Quande Liu, Huchuan Lu, Xintao Wang, Pengfei Wan, Kun Gai, Xu Jia

机构 * Dalian University of Technology(大连理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 MultiShotMaster通过引入两种新型RoPE变体和自动化数据标注管道,实现多镜头视频的灵活生成与可控性。

Comments Project Page: https://qinghew.github.io/MultiShotMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02520 2025-12-03 cs.CV stat.ML 57%

On the Problem of Consistent Anomalies in Zero-Shot Anomaly Detection

关于零样本异常检测中一致异常问题的研究

Tai Le-Gia

机构 * Department of Mathematics Graduate School(数学系研究生院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出CoDeGraph框架,解决零样本异常检测中的一致异常问题,并扩展至3D医学影像,实现无需训练的零样本检测。

Comments PhD Dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02502 2025-12-03 cs.IR cs.AI 57%

AskNearby: An LLM-Based Application for Neighborhood Information Retrieval and Personalized Cognitive-Map Recommendations

AskNearby: 一种基于LLM的邻里信息检索与个性化认知地图推荐应用

Luyao Niu, Zhicheng Deng, Boyang Li, Nuoxian Huang, Ruiqi Liu, Wenjia Zhang

机构 * Peking University(北京大学) Qianmo Smart Link(千摩智能链接) New York University(纽约大学) Imperial College London(伦敦帝国学院) Tencent(腾讯) Tongji University(同济大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 AskNearby通过整合检索增强生成和认知地图模型,提升邻里信息检索与个性化推荐效果,解决局部生活信息可及性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02710 2025-12-03 cs.CE 50%

Beyond N-grams: A Hierarchical Reward Learning Framework for Clinically-Aware Medical Report Generation

超越n-gram:一种面向临床意识的医疗报告生成层次奖励学习框架

Yuan Wang, Shujian Gao, Jiaxiang Liu, Songtao Jiang, Haoxiang Xia, Xiaotian Zhang, Zhaolu Kang, Yemin Wang, Zuozhu Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出HiMed-RL框架,通过层次化奖励学习提升医疗报告生成的临床质量与事实准确性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22479 2025-12-03 cs.CL 50%

NeLLCom-Lex: A Neural-agent Framework to Study the Interplay between Lexical Systems and Language Use

NeLLCom-Lex: 一种神经代理框架用于研究词汇系统与语言使用之间的相互作用

Yuqing Zhang, Ecesu Ürker, Tessa Verhoef, Gemma Boleda, Arianna Bisazza

机构 * Center for Language and Cognition, University of Groningen(语言与认知中心,格罗宁根大学) Department of Translation and Language Sciences, Universitat Pompeu Fabra(翻译与语言科学系,庞培法拉大学) Leiden Institute of Advanced Computer Science, Leiden University(莱顿高级计算机科学研究所,莱顿大学) Catalan Institution for Research and Advanced Studies (ICREA)(加泰罗尼亚研究与高级科学研究所(ICREA))

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 NeLLCom-Lex通过神经代理框架模拟词汇系统演变,研究词汇与语言使用间的相互作用及语义变化机制。

Comments Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05036 2025-12-03 cs.CL 50%

From Word Vectors to Multimodal Embeddings: Techniques, Applications, and Future Directions For Large Language Models

从词向量到多模态嵌入:大型语言模型的技术、应用与未来方向

Charles Zhang, Benji Peng, Xintian Sun, Qian Niu, Junyu Liu, Keyu Chen, Ming Li, Pohsun Feng, Ziqian Bi, Ming Liu, Yichao Zhang, Xinyuan Song, Cheng Fei, Caitlyn Heqi Yin, Lawrence KQ Yan, Hongyang He, Tianyang Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Simon Fraser University(西蒙弗雷泽大学) Kyoto University(京都大学) National Taiwan Normal University(台湾师范大学) Purdue University(普渡大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) Emory University(埃默里大学) Cornell University(康奈尔大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) The Hong Kong University of Science(香港科学大学) University of Liverpool(利物浦大学) University of Warwick(沃里克大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文综述了从词向量到多模态嵌入的发展,探讨了大型语言模型的技术、应用及未来方向。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 2 篇

2512.02631 2025-12-03 cs.LG 57%

SeeNav-Agent: Enhancing Vision-Language Navigation with Visual Prompt and Step-Level Policy Optimization

SeeNav-Agent: 通过视觉提示和分步策略优化增强视觉语言导航

Zhengcheng Wang, Zichuan Lin, Yijun Yang, Haobo Fu, Deheng Ye

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

AI总结 SeeNav-Agent通过视觉提示和分步策略优化提升视觉语言导航性能,实验显示其在导航成功率上优于现有模型。

Comments 12 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02423 2025-12-03 cs.CV 57%

GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning

GUI探索实验室:通过多轮强化学习提升代理的屏幕导航

Haolong Yan, Yeqing Shen, Xin Huang, Jia Wang, Kaijun Tan, Zhixuan Liang, Hongxin Li, Zheng Ge, Osamu Yoshie, Si Li, Xiangyu Zhang, Daxin Jiang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) StepFun Waseda University(早稻田大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV

AI总结 GUI探索实验室通过多轮强化学习提升代理屏幕导航能力,结合监督微调和交互式试错,实现更高效和通用的GUI代理训练。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 5 篇

2510.16295 2025-12-03 cs.CV cs.AI 81%

OpenLVLM-MIA: A Controlled Benchmark Revealing the Limits of Membership Inference Attacks on Large Vision-Language Models

OpenLVLM-MIA:一个揭示大型视觉-语言模型上成员推断攻击局限性的受控基准

Ryoto Miyamoto, Xin Fan, Fuyuko Kido, Tsuneo Matsumoto, Hayato Yamana

机构 * Waseda University(早稻田大学) Hitotsubashi University(立命馆大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 OpenLVLM-MIA通过受控基准揭示大型视觉-语言模型上成员推断攻击的局限性,表明现有方法性能接近随机水平,为隐私保护技术发展提供基础。

Comments WACV2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02161 2025-12-03 cs.CV 79%

FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges

FineGRAIN:通过视觉语言模型法官评估文本到图像模型的故障模式

Kevin David Hayes, Micah Goldblum, Vikash Sehwag, Gowthami Somepalli, Ashwinee Panda, Tom Goldstein

机构 * University of Maryland(马里兰大学) Columbia University(哥伦比亚大学) Sony AI(索尼人工智能)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV

AI总结 FineGRAIN通过视觉语言模型评估文本到图像模型的故障模式,揭示属性保真度和物体表示的系统性错误,强调了针对性基准测试对生成模型可靠性的重要性。

Comments Accepted to NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02361 2025-12-03 cs.CV cs.AI 62%

VACoT: Rethinking Visual Data Augmentation with VLMs

VACoT:重新思考视觉数据增强与VLMs

Zhengzhuo Xu, Chong Sun, SiNan Du, Chen Li, Jing Lyu, Chun Yuan

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc(腾讯微信视觉部门)

专题命中 幻觉与鲁棒性 :visual language model(abstract);分类 cs.CV、cs.AI

AI总结 VACoT通过在推理过程中动态调用图像增强,提升VLMs在挑战性和分布外输入中的鲁棒性,特别是在OCR对抗场景中,通过高效的智能强化学习减少训练开销并增强感知任务的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02973 2025-12-03 cs.CV cs.CL cs.CR 57%

Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities

基于上下文的图像攻击:如何通过视觉上下文暴露多模态安全漏洞

Yuan Xiong, Ziqi Miao, Lijun Li, Chen Qian, Jie Li, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Renmin University of China(中国人民大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出上下文图像攻击方法,通过多智能体系统和四种可视化策略,有效利用图像的上下文信息对多模态大语言模型进行劫持攻击,实验结果显示攻击效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02263 2025-12-03 cs.HC cs.GR 50%

DepthScape: Authoring 2.5D Designs via Depth Estimation, Semantic Understanding, and Geometry Extraction

DepthScape: 通过深度估计、语义理解和几何提取进行2.5D设计创作

Xia Su, Cuong Nguyen, Matheus A. Gadelha, Jon E. Froehlich

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 DepthScape通过深度估计、语义理解和几何提取,实现2.5D设计创作,提升视觉真实感与动态效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 8 篇

2512.02536 2025-12-03 cs.CV 85%

WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens

WeMMU: 通过噪声查询标记增强视觉-语言模型与扩散模型的桥梁

Jian Yang, Dacheng Yin, Xiaoxuan He, Yong Li, Fengyun Rao, Jing Lyu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学) ZheJiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 WeMMU通过噪声查询标记和VAE分支,提升视觉-语言模型与扩散模型的连接效率,缓解泛化崩溃问题,实现稳定持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏