arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-21 至 2026-01-21 共收录 102 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 31 篇

2601.14081 2026-01-21 cs.SE 50%

Feature-Aware Test Generation for Deep Learning Models

面向深度学习模型的特征感知测试生成

Xingcheng Chen, Oliver Weissl, Andrea Stocco

专题命中 视觉定位与Grounding :vision-language model(abstract)

AI总结 本文提出Detect框架,通过特征感知扰动生成高质量测试用例,揭示模型中的捷径行为和未被准确度指标捕捉的bug,提升深度学习模型的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14007 2026-01-21 cs.CL 50%

BACH-V: Bridging Abstract and Concrete Human-Values in Large Language Models

BACH-V: 联结抽象与具体的人类价值观在大语言模型中

Junyu Zhang, Yipeng Kang, Jiong Guo, Jiayu Zhan, Junqi Wang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 BACH-V研究通过探测和引导方法揭示大语言模型中抽象与具体价值观的联结机制,发现其能稳定锚定抽象价值观以影响具体决策。

Comments 34 pagess, 16 figures, 6 tables, submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13882 2026-01-21 cs.CL 50%

OpenLearnLM Benchmark: A Unified Framework for Evaluating Knowledge, Skill, and Attitude in Educational Large Language Models

OpenLearnLM基准:一个评估教育大型语言模型知识、技能和态度的统一框架

Unggi Lee, Sookbun Lee, Heungsoo Choi, Jinseo Lee, Haeun Park, Younghoon Jeon, Sungmin Cho, Minju Kang, Junbo Koh, Jiyeong Bae, Minwoo Nam, Juyeon Eun, Yeonji Jung, Yeil Jeong

机构 * Chosun University(chosun大学) Korea University(韩国大学) Ewha Womans University(成均馆大学) Korea Institute for Curriculum and Evaluation(韩国课程评价院) Seoul National University(首尔国立大学) Texas A&M University(德克萨斯农工大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 OpenLearnLM基准通过统一框架评估教育大型语言模型的知识、技能和态度,揭示不同模型在多维度上的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13297 2026-01-21 q-bio.NC 50%

Multifaceted neural representation of words in naturalistic language

自然语言中词语的多维神经表征

Xuan Yang, Chuanji Gao, Cheng Xiao, Nicholas Riccardi, Rutvik H. Desai

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究通过心理语言学建模与fMRI结合,揭示了词语多维属性在自然语言理解中的神经表征,发现八个潜在维度支持不同的认知功能。

Comments 65 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11722 2026-01-21 cs.CL cs.IR 50%

RAC: Retrieval-Augmented Clarification for Faithful Conversational Search

RAC:基于检索的澄清以实现可靠的对话搜索

Ahmed Rayane Kebir, Vincent Guigue, Lynda Said Lhadj, Laure Soulier

机构 * Sorbonne Université, CNRS, ISIR, F-75005 Paris, France(索邦大学、国家科学研究中心、ISIR、法国巴黎) Ecole nationale Supérieure d’Informatique (ESI), Algeria(信息技术国家高等学院(ESI)、阿尔及利亚) AgroParisTech, UMR MIA-PS, Palaiseau, France(农业巴黎技术学院、UMR MIA-PS、法国帕莱索)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 RAC通过检索增强的方法生成基于语料库的澄清问题,提高对话搜索的准确性与可靠性。

Comments This is the author's version of the work. The definitive version is published in: Proceedings of the 48th European Conference on Information Retrieval (ECIR '26), 29 March--2 April, 2026, Delft, Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 1 篇

2601.10462 2026-01-21 cs.AI cs.CV 62%

ChartComplete: A Taxonomy-based Inclusive Chart Dataset

ChartComplete: 基于分类的包容性图表数据集

Ahmad Mustapha, Charbel Toumieh, Mariette Awad

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 ChartComplete数据集基于图表分类学,涵盖30种图表类型,为多模态大语言模型提供新的基准测试资源。

Comments 7 pages, 4 figures, 3 tables, 1 algorithm. Dataset and source code available at https://github.com/AI-DSCHubAUB/ChartComplete-Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 4 篇

2601.12742 2026-01-21 cs.RO cs.AI 83%

AirHunt: Bridging VLM Semantics and Continuous Planning for Efficient Aerial Object Navigation

AirHunt: 通过融合视觉语言模型语义与连续规划实现高效空中物体导航

Xuecheng Chen, Zongzhuo Liu, Jianfa Ma, Bang Du, Tiantian Zhang, Xueqian Wang, Boyu Zhou

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) Department of Physics, Southern University of Science and Technology(南方科技大学物理系)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 AirHunt通过融合视觉语言模型语义与连续规划,实现高效空中物体导航,提升开放集物体定位的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12479 2026-01-21 cs.RO 67%

Language-Based Swarm Perception: Decentralized Person Re-Identification via Natural Language Descriptions

基于语言的群体感知:通过自然语言描述实现去中心化的人员重识别

Miquel Kegeleirs, Lorenzo Garattoni, Gianpiero Francesca, Mauro Birattari

机构 * IRIDIA, Université libre de Bruxelles(IRIDIA,布鲁塞尔自由大学) Toyota Motor Europe(丰田欧洲 motors)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 本文提出一种基于自然语言的去中心化人员重识别方法,通过视觉-语言模型生成文本描述,实现群体协作识别与可解释性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14091 2026-01-21 cs.RO cs.AI 57%

Zero-shot adaptable task planning for autonomous construction robots: a comparative study of lightweight single and multi-AI agent systems

零样本适应性任务规划用于自主建造机器人:轻量级单 agent 和多 agent 系统的比较研究

Hossein Naderi, Alireza Shojaei, Lifu Huang, Philip Agee, Kereshmeh Afsari, Abiola Akanmu

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI

AI总结 本研究通过比较轻量级单 agent 和多 agent 系统,探索了零样本适应性任务规划在自主建造机器人中的应用,展示了四 agent 团队在效率和成本上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11631 2026-01-21 cs.CV 57%

Compress to Focus: Efficient Coordinate Compression for Policy Optimization in Multi-Turn GUI Agents

压缩以聚焦:面向多轮GUI代理的高效坐标压缩政策优化

Yurun Song, Jiong Yin, Rongjunchen Zhang, Ian G. Harris

机构 * HiThink Research(HiThink研究院) University of California, Irvine(加州大学尔湾分校) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文提出CCPO框架,通过坐标感知空间压缩和基于距离的优势函数,实现多轮GUI代理的高效政策优化,达到SOTA性能并显著提升压缩效率与训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 8 篇

2601.12865 2026-01-21 cs.CV 83%

Proxy Robustness in Vision Language Models is Effortlessly Transferable

视觉语言模型中的代理鲁棒性可以轻易转移

Xiaowei Fu, Fuxiang Huang, Lei Zhang

机构 * Chongqing Key Laboratory of Bio-perception(重庆生物感知实验室) Multimodal Intelligent Information Processing, Chongqing University, Chongqing 401331, China(多模态智能信息处理,重庆大学,重庆401331,中国) School of Microelectronics(微电子学院) Communication Engineering, Chongqing University, Chongqing 401331, China(通信工程,重庆大学,重庆401331,中国) School of Data Science, Lingnan University, Hong Kong(数据科学学院,岭南大学,香港)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出HPT-GPD框架,通过异构代理转移提升视觉语言模型的对抗鲁棒性,同时缓解过拟合问题,增强零样本自然泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12672 2026-01-21 cs.CV 83%

VILTA: A VLM-in-the-Loop Adversary for Enhancing Driving Policy Robustness

VILTA:一种用于增强驾驶策略鲁棒性的视觉语言模型闭环对抗者

Qimao Chen, Fang Li, Shaoqing Xu, Zhiyi Lai, Zixun Xie, Yuechen Luo, Shengyin Jiang, Hanbing Li, Long Chen, Bing Wang, Yi Zhang, Zhi-Xin Yang

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 VILTA通过整合视觉语言模型到闭环训练中,提升自动驾驶策略在长尾事件中的安全性和鲁棒性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13238 2026-01-21 cs.CV cs.AI 81%

A Semantic Decoupling-Based Two-Stage Rainy-Day Attack for Revealing Weather Robustness Deficiencies in Vision-Language Models

基于语义解耦的两阶段雨天攻击:揭示视觉-语言模型在天气鲁棒性方面的缺陷

Chengyin Hu, Xiang Chen, Zhe Jia, Weiwen Shi, Fengyu Zhang, Jiujiang Guo, Yiwei Wei

机构 * Chengyin Hu(独立研究者) Xiang Chen(独立研究者) Zhe Jia(独立研究者) Weiwen Shi(独立研究者) Fengyu Zhang(独立研究者) Jiujiang Guo(独立研究者) Yiwei Wei(独立研究者)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于语义解耦的两阶段雨天攻击框架,揭示了视觉-语言模型在天气鲁棒性方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12443 2026-01-21 cs.CV cs.AI 81%

Adversarial Defense in Vision-Language Models: An Overview

视觉-语言模型中的对抗防御:概述

Xiaowei Fu, Lei Zhang

机构 * School of Microelectronics and Communication Engineering(微电子与通信工程学院) Chongqing University(重庆大学) Chongqing, China(中国重庆)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了视觉-语言模型对抗防御的最新进展,探讨了三种主要防御范式及其优缺点,旨在提升模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04459 2026-01-21 cs.CL cs.LG 70%

Uncertainty-Aware Collaborative System of Large and Small Models for Multimodal Sentiment Analysis

面向大规模和小规模模型的不确定性感知协作系统用于多模态情感分析

Shiqin Han, Manning Gao, Menghua Jiang, Yuncheng Jiang, Haifeng Hu, Sijie Mai

机构 * School of Computer Science, South China Normal University(计算机科学学院,华南师范大学) School of Artificial Intelligence, South China Normal University(人工智能学院,华南师范大学) School of Electronics and Information Technology, Sun Yat-sen University(电子与信息工程学院,中山大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

AI总结 本文提出U-ACS系统,通过整合UBM与MLLMs,利用不确定性感知机制提升多模态情感分析的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13462 2026-01-21 cs.AI 57%

SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation

SpatialBench-UC: 文本到图像生成中空间提示遵循的不确定性感知评估

Amine Rostane

机构 * ESIEA

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 SpatialBench-UC通过评估文本到图像生成中空间提示遵循的不确定性,提出了一个可重复的基准测试,以提高模型在空间指令下的表现和置信度评估。

Comments 19 pages, includes figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20136 2026-01-21 cs.CL cs.AI cs.IR 57%

Multi-Stage Verification-Centric Framework for Mitigating Hallucination in Multi-Modal RAG

多阶段验证导向框架用于缓解多模态RAG中的幻觉

Baiyu Chen, Wilson Wongso, Xiaoqian Hu, Yue Tan, Flora Salim

机构 * The University of New South Wales(新南威尔士大学)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.AI

AI总结 本文提出了一种多阶段验证导向框架,通过优先考虑事实准确性和真实性来缓解多模态RAG中的幻觉问题,并在KDD Cup 2025中取得第三名。

Comments KDD Cup 2025 Meta CRAG-MM Challenge: Third Prize in the Single-Source Augmentation Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07601 2026-01-21 cs.CV 57%

Unified Source-Free Domain Adaptation

统一无源领域适应

Song Tang, Wenxin Su, Mao Ye, Boyu Wang, Xiatian Zhu

机构 * Institute of Machine Intelligence, University of Shanghai for Science and Technology(上海理工大学机器智能研究院) TAMS Group, Department of Informatics, Universität Hamburg(汉堡大学信息学院TAMS小组) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CausalDA,从因果性角度解决统一无源领域适应问题,通过预训练视觉-语言模型和信息瓶颈提升模型鲁棒性,在多种SFDA场景中取得新成果。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 22 篇

2601.14188 2026-01-21 cs.CV 86%

IIR-VLM: In-Context Instance-level Recognition for Large Vision-Language Models

IIR-VLM:面向大视觉-语言模型的上下文实例识别

Liang Shi, Wei Li, Kevin M Beussman, Lin Chen, Yun Fu

机构 * Northeastern University(东北大学) Wyze Labs, Inc.(Wyze实验室)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(title);分类 cs.CV

AI总结 IIR-VLM通过整合预训练的ILR专家模型,提升大视觉-语言模型在上下文实例识别中的性能,有效解决细粒度辨别问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12744 2026-01-21 cs.AI cs.NI cs.SE 83%

Vision Language Models for Optimization-Driven Intent Processing in Autonomous Networks

面向自主网络的基于视觉语言模型的优化驱动意图处理

Tasnim Ahmed, Yifan Zhu, Salimur Choudhury

机构 * School of Computing, Queen's University, Ontario, Canada(计算学院,女王大学,安大略,加拿大)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出IntentOpt基准测试,评估不同视觉语言模型在生成网络优化代码中的性能,发现视觉参数提取和程序化思维提示显著降低执行成功率,开源模型表现低于闭源模型。

Comments Accepted for presentation at The IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08604 2026-01-21 cs.CV cs.AI cs.LG 82%

Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization

可迁移的模型无关视觉-语言模型适应方法用于高效的弱到强泛化

Jihwan Park, Taehoon Song, Sanghyeok Lee, Miso Choi, Hyunwoo J. Kim

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 TransMiter是一种轻量级适配器,通过无监督方式提升视觉-语言模型的泛化能力,实现高效的知识迁移。

Comments AAAI2026 Oral (camera ready version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06474 2026-01-21 cs.CV cs.AI 81%

SparseOccVLA: Bridging Occupancy and Vision-Language Models via Sparse Queries for Unified 4D Scene Understanding and Planning

SparseOccVLA: 通过稀疏查询弥合占用与视觉语言模型之间的鸿沟,实现统一的4D场景理解和规划

Chenxu Dang, Jie Wang, Guang Li, Zhiwen Hou, Zihan You, Hangjun Ye, Jie Ma, Long Chen, Yan Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 SparseOccVLA通过稀疏查询整合视觉语言模型与语义占用,实现统一的4D场景理解和规划,提升自动驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12042 2026-01-21 cs.CR cs.AI 79%

Less Is More -- Until It Breaks: Security Pitfalls of Vision Token Compression in Large Vision-Language Models

少即是多——直到它破裂:大视觉-语言模型中视觉标记压缩的安全隐患

Xiaomei Zhang, Zhaoxi Zhang, Leo Yu Zhang, Yanjun Zhang, Guanhong Tao, Shirui Pan

机构 * Griffith University(格里菲斯大学) University of Technology Sydney(悉尼技术大学) University of Utah(犹他大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI

AI总结 本研究揭示了视觉标记压缩在大视觉-语言模型中显著降低鲁棒性的问题,并提出压缩感知攻击以系统研究该漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24555 2026-01-21 cs.LG 74%

From Perception to Punchline: Empowering VLM with the Art of In-the-wild Meme

从感知到 punchline:通过野生表情包艺术赋能 VLM

Xueyan Li, Yingyi Xue, Mengjie Jiang, Qingzi Zhu, Yazhe Niu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Software Engineering(软件工程学院) Columbia Engineering(哥伦比亚工程学院) Columbia University(哥伦比亚大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 VLM训练与架构 :VLM(title);分类 cs.LG

AI总结 HUMOR 通过分层推理和群体偏好对齐,提升 VLM 在多模态生成中的推理多样性与幽默质量。

Comments 46 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13385 2026-01-21 cs.CV cs.AI 73%

Organ-Aware Attention Improves CT Triage and Classification

器官感知注意力提升CT分诊与分类

Lavsen Dahal, Yubraj Bhandari, Geoffrey D. Rubin, Joseph Y. Lo

机构 * Duke University(杜克大学) University of Arizona(亚利桑那大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 ORACLE-CT通过器官感知注意力和标量融合方法,在胸部和腹部CT分诊中实现最先进的分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13797 2026-01-21 cs.CV 70%

PREGEN: Uncovering Latent Thoughts in Composed Video Retrieval

PREGEN:在合成视频检索中揭示潜在思想

Gabriele Serussi, David Vainshtein, Jonathan Kouchly, Dotan Di Castro, Chaim Baskin

机构 * Bosch Center for AI(博世人工智能中心) INSIGHT Lab(洞察实验室) Ben-Gurion University of the Negev(巴伊兰大学内盖夫分校)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 PREGEN通过结合预训练VLM和轻量级编码模型,高效解决合成视频检索问题,显著提升检索性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12493 2026-01-21 cs.CV 70%

Histopath-C: Towards Realistic Domain Shifts for Histopathology Vision-Language Adaptation

Histopath-C: 向 histopathology 视觉-语言适应的现实领域偏移迈进

Mehrdad Noori, Gustavo Adolfo Vargas Hakim, David Osowiechi, Fereshteh Shakeri, Ali Bahri, Moslem Yazdanpanah, Sahar Dastani, Ismail Ben Ayed, Christian Desrosiers

机构 * LIVIA, ÉTS Montreal, Canada International Laboratory on Learning Systems (ILLS)(LIVIA,蒙特利尔工程学院,加拿大国际学习系统实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 Histopath-C通过引入现实合成损坏的基准和LATTE策略,提升组织病理学图像的视觉-语言适应鲁棒性。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12481 2026-01-21 cs.CV cs.GR 70%

NeuralFur: Animal Fur Reconstruction From Multi-View Images

NeuralFur: 从多视角图像中重建动物毛发

Vanessa Sklyarova, Berna Kabadayi, Anastasios Yiannakidis, Giorgio Becherini, Michael J. Black, Justus Thies

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ETH Zürich(苏黎世联邦理工学院) Technical University of Darmstadt(德累斯顿技术大学) University of Tübingen(图宾根大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 NeuralFur通过视觉语言模型指导多视角图像重建,实现不同动物的高保真3D毛发建模。

Comments For additional results and code, please refer to https://neuralfur.is.tue.mpg.de

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11724 2026-01-21 cs.CV 70%

SemAlign: Language Guided Semi-supervised Domain Generalization

SemAlign:语言引导的半监督领域泛化

Muditha Fernando, Kajhanan Kailainathan, Krishnakanth Nagaratnam, Isuranga Udaravi Bandara Senavirathne, Ranga Rodrigo

机构 * University of Moratuwa(穆塔瓦大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 SemAlign通过将模型中间特征与视觉语言模型的语义特征空间对齐,结合增强和正则化策略,提升半监督领域泛化的性能。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13247 2026-01-21 cs.CL cs.AI cs.CV cs.LG cs.MM 67%

Aligning Agentic World Models via Knowledgeable Experience Learning

通过知识性经验学习对齐代理世界模型

Baochang Ren, Yunzhi Yao, Rui Sun, Shuofei Qiao, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 WorldMind通过知识性经验学习对齐代理世界模型,解决物理模拟中的幻觉问题,实现跨环境的高效迁移。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏