arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-22 至 2026-01-22 共收录 42 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2601.15287 2026-01-22 cs.CV 74%

Towards Understanding Best Practices for Quantization of Vision-Language Models

朝着理解视觉-语言模型量化最佳实践

Gautom Das, Vincent La, Ethan Lau, Abhinav Shrivastava, Matthew Gwilliam

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 视觉问答 :vision-language model(title);分类 cs.CV

AI总结 本研究探讨了视觉-语言模型量化方法对多模态流水线性能的影响,发现LLM低位量化在减少bpw时仍保持高精度,为高效部署MLLMs提供实践指导。

Comments 15 pages, 12 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21182 2026-01-22 cs.CV cs.CL 70%

KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution

KBE-DME: 通过知识增强的基准进化实现动态多模态评估

Junzhe Zhang, Huixuan Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology(王轩计算机技术研究所) Peking University(北京大学)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 KBE-DME通过整合多模态知识和动态基准进化,实现对多模态大语言模型能力的更全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14757 2026-01-22 cs.CV 57%

ReinPath: A Multimodal Reinforcement Learning Approach for Pathology

ReinPath:一种用于病理学的多模态强化学习方法

Kangcheng Zhou, Jun Jiang, Qing Zhang, Shuang Zheng, Qingli Li, Shugong Xu

机构 * East China Normal University(华东师范大学) Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 ReinPath提出了一种多模态强化学习方法,通过构建高质量病理学VQA数据集,结合语义奖励策略和群体相对策略优化,提升了病理图像和文本的多模态推理能力,并在零样本分类任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 10 篇

2512.05665 2026-01-22 cs.CL cs.CV 83%

Interleaved Latent Visual Reasoning with Selective Perceptual Modeling

交错的潜在视觉推理与选择性感知建模

Shuai Dong, Siyuan Wang, Xingyu Liu, Chenglin Li, Haowen Hou, Zhongyu Wei

机构 * China University of Geosciences, Wuhan(中国地质大学(武汉)) Shanghai Innovation Institute(上海创新研究院) University of Southern California(南加州大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 ILVR通过交错潜在视觉表示与文本生成,实现动态状态演变与精确感知建模的统一,提升多模态推理性能。

Comments 18 pages, 11 figures. Code available at https://github.com/XD111ds/ILVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14921 2026-01-22 cs.RO cs.AI 79%

Vision-Language Models on the Edge for Real-Time Robotic Perception

边缘计算上的视觉-语言模型用于实时机器人感知

Sarat Ahmad, Maryam Hafeez, Syed Ali Raza Zaidi

机构 * School of Electronic and Electrical Engineering(电子与电气工程学院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文研究了在边缘计算平台上部署视觉-语言模型以提高机器人感知的实时性与准确性,通过实验对比边缘与云部署的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14602 2026-01-22 cs.CV 77%

3D Space as a Scratchpad for Editable Text-to-Image Generation

3D空间作为可编辑的文本到图像生成的草稿纸

Oindrila Saha, Vojtech Krs, Radomir Mech, Subhransu Maji, Matheus Gadelha, Kevin Blackburn-Matzen

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Adobe Research(Adobe研究)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual language model(abstract);分类 cs.CV

AI总结 本文提出一种基于3D空间推理的文本到图像生成方法,通过可编辑的3D网格实现空间一致性,提升图像生成的精度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14339 2026-01-22 cs.CV cs.AI 76%

CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments

CityCube:在城市环境中对视觉-语言模型的跨视角空间推理进行基准测试

Haotian Xu, Yue Hu, Zhengqiu Zhu, Chen Gao, Ziyou Wang, Junreng Rao, Wenhao Lu, Weishi Li, Quanjun Yin, Yong Li

机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) BNRist, Tsinghua University(清华大学北京研究院) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 CityCube是一个用于评估视觉-语言模型在城市环境中跨视角空间推理能力的基准,通过多视角问答对揭示模型与人类表现的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15016 2026-01-22 cs.CV 70%

LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding

LiViBench:面向交互式直播视频理解的多模态基准测试

Xiaodong Wang, Langling Huang, Zhirong Wu, Xu Zhao, Teng Xu, Xuhong Xia, Peixi Peng

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 LiViBench是首个面向交互式直播视频的多模态基准测试,通过定制化两阶段指令微调和视频到评论检索模块,提升模型对直播视频的理解能力,并在多个基准测试中取得优异成绩。

Comments AAAI 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15286 2026-01-22 cs.CV cs.AI cs.LG cs.RO 67%

Iterative Refinement Improves Compositional Image Generation

迭代细化改进组合图像生成

Shantanu Jaiswal, Mihir Prabhudesai, Nikash Bhardwaj, Zheyang Qin, Amir Zadeh, Chuan Li, Katerina Fragkiadaki, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Lambda AI

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种迭代细化策略,通过视觉-语言模型反馈提升组合图像生成质量,实验显示在多个基准上均优于并行采样方法。

Comments Project webpage: https://iterative-img-gen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11932 2026-01-22 cs.CV 57%

Hyperphantasia: A Benchmark for Evaluating the Mental Visualization Capabilities of Multimodal LLMs

Hyperphantasia: 一个多模态大语言模型心理可视化能力评估基准

Mohammad Shahab Sepehri, Berk Tinaz, Zalan Fabian, Mahdi Soltanolkotabi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 Hyperphantasia是一个评估多模态大语言模型心理可视化能力的合成基准,通过四个精心设计的谜题揭示了人类与当前模型之间的性能差距,并探索了强化学习在提升视觉模拟能力上的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14610 2026-01-22 cs.CV 57%

Learning Consistent Taxonomic Classification through Hierarchical Reasoning

通过层次推理学习一致的分类

Zhenghong Li, Kecheng Zheng, Haibin Ling

机构 * Stony Brook University(石溪大学) Ant Research(蚂蚁研究院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 VL-Taxon通过两阶段层次推理框架提升分类的叶级别准确性和层次一致性,实验表明其在iNaturalist-2021数据集上性能优于现有模型。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15129 2026-01-22 cs.CL 50%

RSNA Large Language Model Benchmark Dataset for Chest Radiographs of Cardiothoracic Disease: Radiologist Evaluation and Validation Enhanced by AI Labels (REVEAL-CXR)

用于心胸疾病胸部X光影像的RSNA大语言模型基准数据集:通过AI标签增强的放射科评估和验证(REVEAL-CXR)

Yishu Wei, Adam E. Flanders, Errol Colak, John Mongan, Luciano M Prevedello, Po-Hao Chen, Henrique Min Ho Lee, Gilberto Szarf, Hamilton Shoji, Jason Sho, Katherine Andriole, Tessa Cook, Lisa C. Adams, Linda C. Chu, Maggie Chung, Geraldine Brusca-Augello, Djeven P. Deva, Navneet Singh, Felipe Sanchez Tijmes, Jeffrey B. Alpert, Elsie T. Nguyen, Drew A. Torigian, Kate Hanneman, Lauren K Groner, Alexander Phan, Ali Islam, Matias F. Callejas, Gustavo Borges da Silva Teles, Faisal Jamal, Maryam Vazirabad, Ali Tejani, Hari Trivedi, Paulo Kuriki, Rajesh Bhayana, Elana T. Benishay, Yi Lin, Yifan Peng, George Shih

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本研究通过AI辅助标注流程,创建了包含200张胸部影像的基准数据集,用于评估不同模型,同时帮助放射科医生更高效地标注影像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14352 2026-01-22 cs.RO 50%

RoboBrain 2.5: Depth in Sight, Time in Mind

RoboBrain 2.5:视觉深度,思维时间

Huajie Tan, Enshen Zhou, Zhiyu Li, Yijie Xu, Yuheng Ji, Xiansheng Chen, Cheng Chi, Pengwei Wang, Huizhu Jia, Yulong Ao, Mingyu Cao, Sixiang Chen, Zhe Li, Mengzhen Liu, Zixiao Wang, Shanyu Rong, Yaoxu Lyu, Zhongxia Zhao, Peterson Co, Yibo Li, Yi Han, Shaoxuan Xie, Guocai Yao, Songjing Wang, Leiduo Zhang, Xi Yang, Yance Jiao, Donghai Shi, Kunchang Xie, Shaokai Nie, Chunlei Men, Yonghua Lin, Zhongyuan Wang, Tiejun Huang, Shanghang Zhang

机构 * BAAI RoboBrain Team(百度人工智能研究院RoboBrain团队)

专题命中 视觉推理 :grounding(abstract)

AI总结 RoboBrain 2.5通过提升3D空间推理和时间值估计,增强具身智能在复杂精细操作中的物理基础和执行感知能力。

Comments 37 pages, 13 figures, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 11 篇

2601.11910 2026-01-22 cs.CV 83%

A Training-Free Guess What Vision Language Model from Snippets to Open-Vocabulary Object Detection

无需训练的Guess What视觉语言模型:从片段到开放词汇物体检测

Guiying Zhu, Bowen Yang, Yin Zhuang, Tong Zhang, Guanqun Wang, Zhihao Che, He Chen, Lianlin Li

机构 * Aerospace and Informatics Domain(航空航天与信息领域) National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing(空间智能信息处理国家级重点实验室) School of Electronic(电子学院)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出无需训练的Guess What视觉语言模型GW-VLM,通过多尺度视觉语言搜索与上下文概念提示实现开放词汇物体检测的高效检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15164 2026-01-22 cs.RO cs.AI 70%

V-CAGE: Context-Aware Generation and Verification for Scalable Long-Horizon Embodied Tasks

V-CAGE:面向可扩展长时间跨度具身任务的上下文感知生成与验证

Yaru Liu, Ao-bo Wang, Nanyang Ye

机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, England.(计算机科学与技术系,剑桥大学,剑桥,英格兰) Shanghai Jiao Tong University, Shanghai, China(上海交通大学,上海,中国) Wuhan University, Wuhan, Hubei, China(武汉大学,武汉,湖北,中国)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.AI

AI总结 V-CAGE通过上下文感知生成与验证框架,提升大规模具身任务数据集的物理和语义保真度,提高下游策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14406 2026-01-22 cs.CV eess.IV 70%

Large-Scale Label Quality Assessment for Medical Segmentation via a Vision-Language Judge and Synthetic Data

通过视觉-语言裁判和合成数据进行大规模标签质量评估用于医学分割

Yixiong Chen, Zongwei Zhou, Wenxuan Li, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 SegAE通过视觉-语言模型和合成数据评估医学分割标签质量,提升数据效率和训练性能,减少标注成本和质检时间。

Comments ISBI 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14525 2026-01-22 cs.CL cs.AI cs.LG 62%

Towards Execution-Grounded Automated AI Research

面向执行导向的自动化AI研究

Chenglei Si, Zitong Yang, Yejin Choi, Emmanuel Candès, Diyi Yang, Tatsunori Hashimoto

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出自动化执行器,通过执行反馈学习改进LLM预训练和后训练方法,验证了进化搜索在样本效率上的优势,但强化学习存在模式崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10111 2026-01-22 cs.CV cs.AI cs.CR 62%

Training-Free In-Context Forensic Chain for Image Manipulation Detection and Localization

无需训练的上下文取证链用于图像篡改检测与定位

Rui Chen, Bin Liu, Changtao Miao, Xinghao Wang, Yi Li, Tao Gong, Qi Chu, Nenghai Yu

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 ICFC提出一种无需训练的多模态大语言模型框架,用于图像篡改检测与定位,通过可解释的推理流程实现高效且准确的图像分析。

Comments This version was uploaded in error and contains misleading information found in an early draft. The manuscript requires extensive and long-term revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24909 2026-01-22 cs.MA cs.AI cs.CY cs.SE 57%

Computational Foundations for Strategic Coopetition: Formalizing Trust and Reputation Dynamics

战略合作者竞争的计算基础:形式化信任与声誉动态

Vik Pant, Eric Yu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种双层信任模型,结合博弈论与动态信任演变,通过实验验证其在合作者竞争中的有效性。

Comments 57 pages, 20 figures. Second technical report in research program; should be read with foundational companion arXiv:2510.18802. Adapts and extends trustworthiness and reputation material from Pant (2021) doctoral dissertation, University of Toronto. Validation source code: https://github.com/vikpant/strategic-coopetition/tree/master/TR_validation/TR2_trust

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14265 2026-01-22 cs.CY cs.AI cs.CL 57%

From Textbook to Talkbot: A Case Study of a Greek-Language RAG-Based Chatbot in Higher Education

从教材到谈bot:面向高等教育的希腊语基于检索增强生成的聊天机器人案例研究

Maria Eleni Koutsiaki, Marina Delianidi, Chaido Mizeli, Konstantinos Diamantaras, Iraklis Grigoropoulos, Nikolaos Koutlianos

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究开发了一个基于RAG框架的希腊语AI聊天机器人,用于高等教育中的教学支持,旨在提升教育实践和AI技术在语言教育中的应用。

Comments 11 pages, 5 figures, 6th Barcelona Conference on Education (BCE2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13809 2026-01-22 cs.RO cs.AI 57%

DroneVLA: VLA based Aerial Manipulation

DroneVLA:基于VLA的空中操控

Fawad Mehboob, Monijesu James, Amir Habel, Jeffrin Sam, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skoltech(斯克里普金科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 DroneVLA通过结合VLA模型和定制无人机,实现基于自然语言指令的空中物体抓取与递送,展示了在定位和导航中的高精度表现。

Comments This paper has been accepted for publication at LBR of HRI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14607 2026-01-22 physics.geo-ph 50%

SeisBind: Physics-Aware Tri-Modal Representation Binding for Seismic Data via Contrastive Learning

SeisBind:通过对比学习实现地震数据的物理感知三模态表示绑定

Chaohua Liang, Jun Matsushima

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SeisBind通过对比学习将地震数据与物理描述符结合,实现更可解释的地下速度模型构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14460 2026-01-22 cs.IR 50%

Trust Me on This: A User Study of Trustworthiness for RAG Responses

相信我:对RAG响应可信度的用户研究

Weronika Łajewska, Krisztian Balog

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究通过用户实验探讨了不同解释类型如何影响用户对RAG响应的信任度,发现信任受响应清晰度和用户知识影响,而非单纯客观质量。

Comments This is the author's version of the work. The definitive version is published in: Proceedings of the 48th European Conference on Information Retrieval (ECIR '26), March 29-April 2, 2026, Delft, The Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10923 2026-01-22 cs.CR cs.HC 50%

Hidden-in-Plain-Text: A Benchmark for Social-Web Indirect Prompt Injection in RAG

隐于 plain-text:一种用于 RAG 中社会网络间接提示注入的基准测试

Haoze Guo, Ziqi Wei

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 OpenRAG-Soc 提供了一种用于评估 RAG 系统在社会网络间接提示注入攻击下的基准测试工具,通过标准化的端到端评估和可部署的缓解措施,帮助从业者跟踪风险并增强部署安全性。

Comments WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2601.14722 2026-01-22 cs.CL 82%

Typhoon OCR: Open Vision-Language Model For Thai Document Extraction

台风OCR:面向泰语文档提取的开放视觉-语言模型

Surapon Nonesung, Natapong Nitarach, Teetouch Jaknamon, Pittawat Taveekitworachai, Kunat Pipatanakul

机构 * Typhoon, SCB 10X(Typhoon,SCB 10X)

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract)

AI总结 Typhoon OCR 是一个专为泰语文档提取设计的开放视觉-语言模型,通过多阶段数据构建管道训练,实现文本转录、布局重构和结构一致性,性能媲美专有模型且计算成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 4 篇

2601.14622 2026-01-22 cs.RO 78%

Probing Prompt Design for Socially Compliant Robot Navigation with Vision Language Models

通过视觉语言模型探索社交合规机器人导航的提示设计

Ling Xiao, Toshihiko Yamasaki

机构 * Hokkaido University(北海道大学) The University of Tokyo(东京大学)

专题命中 GUI与屏幕智能体 :vision language model(title,abstract)

AI总结 本文通过设计社交合规的提示策略,提升小型视觉语言模型在机器人导航中的行动准确性,发现与自我竞争的提示设计效果最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14777 2026-01-22 cs.CV cs.AI 62%

FunCineForge: A Unified Dataset Toolkit and Model for Zero-Shot Movie Dubbing in Diverse Cinematic Scenes

FunCineForge: 一个统一的数据集工具包和模型,用于多样的影视场景零样本配音

Jiaxuan Liu, Yang Xiang, Han Zhao, Xiangang Li, Zhenhua Ling

机构 * Alibaba Group(阿里巴巴集团) Tongyi Lab(通义实验室)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 FunCineForge提出了一种统一的数据集工具包和模型,用于多样的影视场景零样本配音,通过构建大规模数据集和基于大规模语言模型的模型,提升了音频质量、唇形同步和情绪表达性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14790 2026-01-22 cs.AI 57%

CI4A: Semantic Component Interfaces for Agents Empowering Web Automation

CI4A: 为网络自动化赋能的语义组件接口

Zhi Qiu, Jiazheng Sun, Chenxiao Xia, Jun Zheng, Xin Peng

机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(电子信息学院,北京理工大学) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 CI4A 通过构建语义组件接口,提升代理在网页自动化中的表现,实现 86.3% 的任务成功率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14587 2026-01-22 cs.HC cs.RO 50%

Explainable OOHRI: Communicating Robot Capabilities and Limitations as Augmented Reality Affordances

可解释的面向对象人机交互:通过增强现实 affordances 传达机器人能力和限制

Lauren W. Wang, Mohamed Kari, Parastoo Abtahi

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出X-OOHRI,一种通过AR界面传达机器人能力和限制的可解释面向对象人机交互系统,通过视觉符号和颜色编码提升人机交互效率。

Journal ref Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 3 篇

2601.14261 2026-01-22 cs.CV cs.HC cs.LG 84%

Intelligent Power Grid Design Review via Active Perception-Enabled Multimodal Large Language Models

通过主动感知多模态大语言模型实现智能电网设计审查

Taoliang Tan, Chengwei Ma, Zhen Tian, Zhao Lin, Dongdong Li, Si Shi

机构 * Yangjiang Yangxi Power Supply Bureau, Guangdong Power Grid Co., Ltd., Yangjiang, China(阳江阳西供电局,广东电网公司) Guangdong Laboratory of Artificial Intelligence(广东人工智能实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出基于主动感知多模态大语言模型的智能电网设计审查方法,通过三阶段框架提升对设计错误的识别准确性和审查可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏