arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-06 至 2026-02-06 共收录 34 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2602.04142 2026-02-06 cs.CV cs.AI 81%

JSynFlow: Japanese Synthesised Flowchart Visual Question Answering Dataset built with Large Language Models

JSynFlow:利用大语言模型构建的日本合成流程图视觉问答数据集

Hiroshi Sasaki

机构 * The Japan Research Institute, Limited(日本研究所有限公司)

专题命中 视觉问答 :visual question answering(title);VLM(abstract);分类 cs.CV、cs.AI

AI总结 JSynFlow利用大语言模型生成日本流程图视觉问答数据集,提升VLM在流程图问答任务中的性能。

Comments 7 pages, 1 figure

Journal ref Proceedings of the Annual Conference of JSAI, JSAI2025:2Win587-2Win587, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04924 2026-02-06 cs.LG cs.SD 79%

Knowing When to Answer: Adaptive Confidence Refinement for Reliable Audio-Visual Question Answering

何时回答:可靠音频-视觉问答的自适应置信度细化

Dinh Phu Tran, Jihoon Jeong, Saad Wazir, Seongah Kim, Thao Do, Cem Subakan, Daeyoung Kim

机构 * School of Computing, KAIST, Republic of Korea(韩国釜山科学技术院计算机科学学院) Laval University(拉瓦尔大学) Mila-Quebec AI Institute(魁北克人工智能研究所)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.LG

AI总结 本文提出自适应置信度细化方法,用于提升音频-视觉问答任务中可靠性的性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05728 2026-02-06 cs.CL cs.AI 57%

CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop Question Answering

CompactRAG: 减少多跳问答中的LLM调用和令牌开销

Hao Yang, Zhiyu Yang, Xupeng Zhang, Wei Wei, Yunjie Zhang, Lin Yang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Erik Jonsson School of Engineering and Computer Science, University of Texas at Dallas(埃里克·乔纳森工程与计算机科学学院,德克萨斯大学达拉斯分校) Isoftstone Information Technology (Group) Co.,Ltd.(伊软石信息技术(集团)有限公司) College of Electronic and Information Engineering, Tongji University(电子信息工程学院,同济大学) School of Electronic Information, Central South University(电子信息学院,中南大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 CompactRAG通过解耦离线语料重组与在线推理,减少多跳问答中的LLM调用和令牌消耗,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 13 篇

2602.05570 2026-02-06 cs.AI 79%

TangramSR: Can Vision-Language Models Reason in Continuous Geometric Space?

TangramSR: 视觉-语言模型能否在连续几何空间中推理?

Yikun Zong, Cheston Tan

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

AI总结 TangramSR通过测试时自我改进框架,结合上下文学习和奖励循环,提升视觉-语言模型在连续几何空间中的推理能力。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05552 2026-02-06 cs.RO cs.CV 74%

VLN-Pilot: Large Vision-Language Model as an Autonomous Indoor Drone Operator

VLN-Pilot: 大型视觉-语言模型作为自主室内无人机操作员

Bessie Dominguez-Dager, Sergio Suescun-Ferrandiz, Felix Escalona, Francisco Gomez-Donoso, Miguel Cazorla

机构 * University Institute for Compute Research(计算研究大学研究所) University of Alicante(阿利坎特大学)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV

AI总结 VLN-Pilot利用大型视觉-语言模型实现自主室内无人机导航,通过自然语言指令和视觉感知结合,提高飞行任务的自主性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05789 2026-02-06 cs.CV cs.AI 73%

Allocentric Perceiver: Disentangling Allocentric Reasoning from Egocentric Visual Priors via Frame Instantiation

非自体参照感知器:通过帧实例化解耦非自体参照推理与自体参照视觉先验

Hengyi Wang, Ruiqiang Zhang, Chang Liu, Guanjie Wang, Zehua Ma, Han Fang, Weiming Zhang

机构 * Anhui Province Key Laboratory of Digital Security, University of Science(安徽数字安全重点实验室,科学大学) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 非自体参照感知器通过帧实例化解耦非自体参照推理与自体参照视觉先验,提升空间推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05382 2026-02-06 cs.CV cs.LG 73%

VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs

VRIQ:评估和分析视觉推理IQ的VLMs基准测试

Tina Khezresmaeilzadeh, Jike Zhong, Konstantinos Psounis

机构 * University of Southern California, Los Angeles, USA(美国南加州大学)

专题命中 视觉推理 :vision language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG

AI总结 VRIQ基准测试评估了VLMs的视觉推理能力,发现其在抽象推理任务中表现薄弱,主要源于感知限制,提出细粒度诊断方法以改进多模态系统中的视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06040 2026-02-06 cs.CV 70%

SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs

SwimBird: 在混合自回归大语言模型中实现可切换的推理模式

Jintao Tong, Shilin Yan, Hongwei Xue, Xiaojun Tang, Kunyu Shi, Guannan Zhang, Ruixuan Li, Yixiong Zou

机构 * Huazhong University of Science and Technology(华中科技大学) Accio Team, Alibaba Group(阿里集团Accio团队)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 SwimBird通过动态切换三种推理模式,提升多模态大语言模型在视觉密集任务中的性能,同时保持文本推理能力。

Comments Project Page: https://accio-lab.github.io/SwimBird

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04451 2026-02-06 cs.IR 67%

SDR-CIR: Semantic Debias Retrieval Framework for Training-Free Zero-Shot Composed Image Retrieval

SDR-CIR:一种基于链式推理的语义去偏检索框架用于无训练零样本复合图像检索

Yi Sun, Jinyu Xu, Qing Xie, Jiachen Li, Yanchun Ma, Yongjian Liu

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

AI总结 SDR-CIR通过语义去偏排名方法提升无训练零样本复合图像检索性能。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05273 2026-02-06 cs.RO 67%

Affordance-Aware Interactive Decision-Making and Execution for Ambiguous Instructions

具有包容性的交互决策与执行以应对模糊指令

Hengxuan Xu, Fengbo Lan, Zhixin Zhao, Shengjie Wang, Mengqiao Liu, Jieqian Sun, Yu Cheng, Tao Zhang

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息学院) Computer Science and Engineering Department, Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

AI总结 AIDE通过双流框架整合交互式探索与视觉-语言推理,实现对模糊指令的高效决策与执行,提升机器人在陌生环境中的任务规划能力。

Comments 14 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05544 2026-02-06 cs.AI 57%

Reasoning-guided Collaborative Filtering with Language Models for Explainable Recommendation

基于语言模型的推理引导协同过滤用于可解释推荐

Fahad Anwaar, Adil Mehmood Khan, Muhammad Khalid, Usman Zia, Kezhi Wang

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 RGCF-XRec通过融合推理引导的协同过滤知识与语言模型,实现可解释的序列推荐,提升了推荐性能和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22120 2026-02-06 cs.CV 57%

See Less, See Right: Bi-directional Perceptual Shaping For Multimodal Reasoning

看得少,看得对:双向感知塑造用于多模态推理

Shuoshuo Zhang, Yizhen Zhang, Jingjing Fu, Lei Song, Jiang Bian, Yujiu Yang, Rui Wang

机构 * Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出BiPS,通过双向感知塑造提升多模态推理性能,有效增强细粒度视觉依赖并提升跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08194 2026-02-06 cs.CV 57%

GIQ: Benchmarking 3D Geometric Reasoning of Vision Foundation Models with Simulated and Real Polyhedra

GIQ:基于模拟和真实多面体的3D几何推理视觉基础模型基准测试

Mateusz Michalkiewicz, Anekha Sokhal, Tadeusz Michalkiewicz, Piotr Pawlikowski, Mahsa Baktashmotlagh, Varun Jampani, Guha Balakrishnan

机构 * Rice University(里士大学) The University of Queensland(昆士兰大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 GIQ通过模拟和真实多面体评估视觉基础模型的3D几何推理能力,揭示了现有模型在几何理解上的不足。

Comments Accepted to ICLR 2026. Camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04145 2026-02-06 cs.LG cs.CL cs.MM 57%

Training Data Efficiency in Multimodal Process Reward Models

多模态过程奖励模型中的训练数据效率

Jinyuan Li, Chengsong Huang, Langlin Huang, Shaoyang Xu, Haolin Liu, Wenxuan Zhang, Jiaxin Huang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Singapore University of Technology(新加坡科技设计大学) University of Virginia(弗吉尼亚大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.LG

AI总结 本文提出BIS方法,通过优化标签混合与可靠性,提升多模态过程奖励模型训练的数据效率,仅用10%训练数据即可达到全数据性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05261 2026-02-06 cs.CL 50%

Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR

长度无偏序列策略优化:揭示和控制RLVR中的响应长度变化

Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu

机构 * Meituan(美团)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出LUSPO算法,通过消除长度偏差解决RLVR中响应长度崩溃问题,并在多个任务中展示出优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21826 2026-02-06 cs.CL 50%

Mil-SCORE: Benchmarking Long-Context Geospatial Reasoning and Planning in Large Language Models

Mil-SCORE:大型语言模型中长上下文地理空间推理与规划的基准测试

Aadi Palnitkar, Mingyang Mao, Nicholas Waytowich, Vinicius G. Goecks, Xiaomin Lin

机构 * University of Maryland, College Park MD, USA(马里兰大学) ERA Lab, University of South Florida, Tampa FL, USA(佛罗里达大学埃拉实验室) DEVCOM Army Research Laboratory, Aberdeen Proving Ground MD, USA(国防部陆军研究实验室) EEHPC Lab, Johns Hopkins University, Baltimore MD, USA(约翰霍普金斯大学EEHPC实验室)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 Mil-SCORE是首个针对复杂军事规划情景的多跳问题数据集,旨在评估大型语言模型在长上下文地理空间推理与规划中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 6 篇

2511.11007 2026-02-06 cs.CV cs.AI cs.LG 85%

VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models

VisMem: 通过潜在视觉记忆解锁视觉-语言模型的潜力

Xinlei Yu, Chengming Xu, Guibin Zhang, Zhangquan Chen, Yudong Zhang, Yongbo He, Peng-Tao Jiang, Jiangning Zhang, Xiaobin Hu, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) vivo

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 VisMem通过引入动态潜在视觉记忆模块,提升视觉-语言模型在复杂视觉任务中的性能,实现感知准确性和语义一致性之间的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05215 2026-02-06 cs.CV 79%

E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching

E.M.Ground: 一种具有整体事件感知和匹配的时序地面视频大语言模型

Jiahao Nie, Wenbin An, Gongjie Zhang, Yicheng Xu, Yap-Peng Tan, Alex C. Kot, Shijian Lu

机构 * Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学交叉学科研究生项目) Xi’an Jiaotong University, China(西安交通大学) Alibaba DAMO Academy, Singapore(阿里巴巴达摩院) Institute of Science Tokyo, Japan(东京科学研究院) VinUniversity, Vietnam(文大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 E.M.Ground通过引入事件标记、平滑处理和多粒度特征聚合,提升了时序视频地面任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22650 2026-02-06 cs.CV 57%

RefAM: Attention Magnets for Zero-Shot Referral Segmentation

RefAM:用于零样本指代分割的注意力磁铁

Anna Kukleva, Enis Simsar, Alessio Tonioni, Muhammad Ferjad Naeem, Federico Tombari, Jan Eric Lenssen, Bernt Schiele

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) ETH Zürich(苏黎世联邦理工学院) Google(谷歌) TU Munich(慕尼黑技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 RefAM通过利用扩散模型的注意力机制和停用词处理,实现无需训练的零样本指代分割,提升分割精度和效率。

Comments Project Page: https://refam-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05701 2026-02-06 cs.LG 57%

Statistically Valid Post-Deployment Monitoring Should Be Standard for AI-Based Digital Health

基于AI的数字健康应将统计上有效的部署后监控作为标准

Pavel Dolin, Weizhi Li, Gautam Dasarathy, Visar Berisha

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文主张基于AI的数字健康应采用统计上有效的部署后监控作为标准,提出统计有效且标签效率高的测试框架以确保现实部署的可靠性和安全性。

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06001 2026-02-06 cs.RO 50%

Visuo-Tactile World Models

视觉-触觉世界模型

Carolina Higuera, Sergio Arnaud, Byron Boots, Mustafa Mukadam, Francois Robert Hogan, Franziska Meier

机构 * Paul G. Allen School of Computer Science, University of Washington(华盛顿大学保罗·G·阿伦计算机科学学院) FAIR, Meta(FAIR,Meta)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出视觉-触觉世界模型,通过融合视觉与触觉传感提升机器人在接触丰富任务中的物理建模能力,实验显示其在物体永恒性和运动定律遵守方面表现更优,并在真实机器人任务中实现更高的成功率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00377 2026-02-06 cs.CL 50%

DecompressionLM: Deterministic, Diagnostic, and Zero-Shot Concept Graph Extraction from Language Models

DecompressionLM:从语言模型中确定性、诊断性地提取零样本概念图

Zhaochen Hong, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DecompressionLM通过无状态框架实现零样本概念图提取,揭示语言模型编码内容,解决跨序列耦合、竞争解码效应和可扩展性限制问题,提升压缩模型的知识广度和事实基础评估。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2602.05384 2026-02-06 cs.CV 57%

Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting

Dolphin-v2:通过可扩展的锚点提示实现通用文档解析

Hao Feng, Wei Shi, Ke Zhang, Xiang Fei, Lei Liao, Dingkang Yang, Yongkun Du, Xuecheng Wu, Jingqun Tang, Yang Liu, Hong Chen, Can Huang

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 Dolphin-v2通过可扩展的锚点提示实现通用文档解析,改进了文档类型分类、布局分析和元素检测,提升了对拍摄文档的解析能力并减少错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 2 篇

2602.05049 2026-02-06 cs.CV cs.AI cs.LG cs.RO 67%

VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models

VISTA: 通过视觉跟踪偏好优化增强视觉条件化在视觉-语言-动作模型中

Yiye Chen, Yanan Jian, Xiaoyi Dong, Shuxin Cao, Jing Wu, Patricio Vela, Benjamin E. Lundell, Dongdong Chen

机构 * Nvidia(Nvidia公司) Microsoft(微软公司) University of Oxford(牛津大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 VISTA通过视觉跟踪偏好优化提升视觉条件化,增强VLA模型在视觉-动作对齐和任务性能上的表现。

Comments In submission. Project website: https://vista-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05998 2026-02-06 cs.CV 57%

VisRefiner: Learning from Visual Differences for Screenshot-to-Code Generation

VisRefiner: 从视觉差异中学习以实现截图到代码生成

Jie Deng, Kaichun Yao, Libo Zhang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 VisRefiner通过学习视觉差异提升截图到代码生成的准确性和自我完善能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 2 篇

2602.05710 2026-02-06 cs.CY cs.CL cs.CV cs.LG 62%

Ethology of Latent Spaces

潜在空间的伦理学

Philippe Boisnard

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV、cs.LG

AI总结 本研究通过伦理学视角揭示视觉语言模型潜在空间的非中立性,发现不同模型对政治与文化类别的归因差异显著,提出计算潜在政治化、涌现偏见和三种算法视域制度等核心概念。

Comments 23. pages, 14 figures, presented Hyperheritage International Symposium 9 ( https://paragraphe.univ-paris8.fr/IMG/pdf/programme_colloque_his9_campuscondorcet_v3.pdf ) and accepted for publication in double-blind peer review in French in 2026-2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05105 2026-02-06 cs.AI cs.RO cs.SE 57%

GAMMS: Graph based Adversarial Multiagent Modeling Simulator

基于图的对抗多智能体建模模拟器

Rohan Patil, Jai Malegaonkar, Xiao Jiang, Andre Dion, Gaurav S. Sukhatme, Henrik I. Christensen

机构 * University of Southern California(美国南加州大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 GAMMS是一款轻量级多智能体仿真框架,支持图结构环境下的快速开发与评估,提供可视化反馈和现实基础,适用于复杂领域如交通和通信系统。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 5 篇

2602.05729 2026-02-06 cs.CV cs.LG 84%

Adaptive Global and Fine-Grained Perceptual Fusion for MLLM Embeddings Compatible with Hard Negative Amplification

自适应全局与细粒度感知融合用于兼容硬负样本放大的人脸嵌入

Lexiang Hu, Youze Xue, Dian Li, Gang Liu, Zhouchen Lin

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,智能科学与技术学院,北京大学) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出AGFF-Embed方法,通过自适应融合全局和细粒度语义信息,提升多模态嵌入在一般和细粒度理解上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22936 2026-02-06 cs.CV 83%

PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models

PPE:用于多模态大语言模型中token压缩的位置保持嵌入

Mouxiao Huang, Borui Jiang, Dehua Zheng, Hailin Hu, Kai Han, Xinghao Chen

机构 * Huawei Technologies(华为技术有限公司)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 PPE通过保持位置信息提升多模态大语言模型的token压缩效率和性能

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04104 2026-02-06 cs.HC 67%

Making Videos Accessible for Blind and Low Vision Users Using a Multimodal Agent Video Player

通过多模态代理视频播放器使视频对视障和低视力用户更加可访问

Adriana Olmos, Anoop K. Sinha, Renelito Delos Santos, Ruben Rodriguez Rodriguez, James A. Landay, Sam S. Sepah, Philip Nelson, Shaun K. Kane

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出一种多模态代理视频播放器,通过多层提示编排为视障和低视力用户带来交互式、可访问的视频体验,增强用户自主性和信任感。

详情

展开后加载摘要…

URL PDF HTML 收藏