arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-05 至 2026-02-05 共收录 51 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 9 篇

2602.04413 2026-02-05 cs.CL cs.AI cs.MM 83%

History-Guided Iterative Visual Reasoning with Self-Correction

基于历史的迭代视觉推理与自我校正

Xinglong Yang, Zhilin Peng, Zhanzhan Liu, Haochen Shi, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 视觉推理 :visual reasoning(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 H-GIVR框架通过迭代视觉推理与自我校正,显著提升多模态推理准确性并保持低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20628 2026-02-05 cs.CV 74%

Recov-Vision: Linking Street View Imagery and Vision-Language Models for Post-Disaster Recovery

Recov-Vision:通过街道视图影像与视觉-语言模型实现灾害后恢复

Yiming Xiao, Archit Gupta, Miguel Esparza, Yu-Hsuan Ho, Antonia Sebastian, Hannah Weas, Rose Houck, Ali Mostafavi

机构 * UrbanResilience.AI Lab(UrbanResilience.AI 实验室) Zachry Department of Civil and Environmental Engineering(Zachry 土木与环境工程系) Texas A&M University(德克萨斯A&M大学) Department of Earth, Marine and Environmental Sciences(地球、海洋与环境科学系) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV

AI总结 Recov-Vision通过结合街道视图影像与视觉-语言模型,实现灾害后建筑占用的高精度评估与可解释决策支持。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20977 2026-02-05 cs.CL 71%

Evaluating and Steering Modality Preferences in Multimodal Large Language Model

评估和引导多模态大语言模型中的模态偏好

Yu Zhang, Jinlong Ma, Yongshuai Hou, Xuefeng Bai, Kehai Chen, Yang Xiang, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 视觉推理 :multimodal large language model(title)

AI总结 本文提出MC²基准测试,通过受控证据冲突场景评估和引导多模态大语言模型的模态偏好,揭示了其可通过指令引导和潜在表示控制,并展示了通过表示工程方法提升多模态任务性能的潜力。

Comments Modality Preference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04144 2026-02-05 cs.AI cs.LG 62%

OMG-Agent: Toward Robust Missing Modality Generation with Decoupled Coarse-to-Fine Agentic Workflows

OMG-Agent:迈向鲁棒缺失模态生成的解耦粗到细代理工作流

Ruiting Dai, Zheyu Wang, Haoyu Yang, Yihan Liu, Chengzhi Wang, Zekun Zhang, Zishan Huang, Jiaman Cen, Lisi Mo

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.AI、cs.LG

AI总结 OMG-Agent通过解耦粗到细的代理工作流,有效解决多模态数据缺失问题,提升生成的鲁棒性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04454 2026-02-05 cs.CV 57%

Seg-ReSearch: Segmentation with Interleaved Reasoning and External Search

Seg-ReSearch: 基于交织推理和外部搜索的分割

Tianming Liang, Qirui Du, Jian-Fang Hu, Haichao Jiang, Zicheng Lin, Wei-Shi Zheng

机构 * ISEE Lab, Sun Yat-sen University(中山大学ISEE实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 Seg-ReSearch通过交织推理和外部搜索提升分割系统处理动态开放世界查询的能力,有效克服现有方法的知识瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18321 2026-02-05 cs.MM cs.CL cs.CV 57%

Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning

融合细粒度音频视觉证据以实现鲁棒的多模态情绪推理

Zhixian Zhao, Wenjie Tian, Lei Xie

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 SABER-LLM通过构建大规模情绪推理数据集和结构化证据分解范式,实现鲁棒的多模态情绪推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04290 2026-02-05 cs.CL 50%

Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision

引导验证器:通过动态过程监督实现协作多模态推理

Lingzhuang Sun, Ruitong Liu, Yuxia Zhu, Xiaohan Xu, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本文提出引导验证器框架,通过动态过程监督实现多模态推理的协作优化,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04138 2026-02-05 cs.HC 50%

Counting the Wait: Effects of Temporal Feedback on Downstream Task Performance and Perceived Wait-Time Experience during System-Imposed Delays

等待的计数:时间反馈对下游任务表现及感知等待时间体验的影响

Felicia Fang-Yi Tan, Oded Nov

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 本研究探讨时间反馈对等待体验及后续任务表现的影响,发现不同反馈模式影响用户感知但未影响实际表现。

Comments To be published in ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04112 2026-02-05 cs.CL 50%

DELTA: Deliberative Multi-Agent Reasoning with Reinforcement Learning for Multimodal Psychological Counseling

DELTA: 基于强化学习的多智能体推理用于多模态心理辅导

Jiangnan Yang, Junjie Chen, Fei Wang, Yiqi Nie, Yuxin Liu, Zhangling Duan, Jie Chen

机构 * Anhui University(安徽大学) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究所)

专题命中 视觉推理 :grounding(abstract)

AI总结 DELTA 通过强化学习和多智能体推理提升多模态心理辅导的质量与情感契合度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉定位与Grounding 17 篇

2602.04515 2026-02-05 cs.RO cs.CV 85%

EgoActor: Grounding Task Planning into Spatial-aware Egocentric Actions for Humanoid Robots via Visual-Language Models

EgoActor: 通过视觉语言模型将任务规划接地于空间感知的自我中心动作以实现人形机器人

Yu Bai, MingMing Yu, Chaojie Li, Ziyi Bai, Xinlong Wang, Börje F. Karlsson

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 EgoActor通过视觉语言模型将高层任务指令转化为精确的空间感知动作,实现人形机器人在真实和模拟环境中的稳健任务规划与运动执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04699 2026-02-05 cs.CV 83%

Annotation Free Spacecraft Detection and Segmentation using Vision Language Models

无需标注的空间目标检测与分割使用视觉语言模型

Samet Hicsonmez, Jose Sosa, Dan Pineau, Inder Pal Singh, Arunkumar Rathinam, Abd El Rahman Shabayek, Djamila Aouada

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(安全、可靠性与信任跨学科研究中心(SnT),卢森堡大学)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出了一种基于视觉语言模型的无标注空间目标检测与分割方法,通过伪标签蒸馏提升性能,实现在多个数据集上的精度提升。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16793 2026-02-05 cs.RO 82%

PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence

PhysBrain: 人眼视角数据作为视觉语言模型到物理智能的桥梁

Xiaopeng Lin, Shijie Lian, Bin Yu, Ruoqi Yang, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Yurun Jin, Yukun Shi, Jiyan He, Cong Huang, Bojun Cheng, Kai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :vision language model(title,abstract);grounding(abstract)

AI总结 PhysBrain通过将人类眼动视频转化为多级具身监督,提升机器人在眼动感知和长期规划中的能力,实现从人类视角到机器人控制的有效迁移。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17729 2026-02-05 cs.AI 79%

M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark

M^3-Bench: 多模态、多跳、多线程工具使用 MLLM agent 评估基准

Yang Zhou, Mingyu Zhao, Zhenting Wang, Difei Gu, Bangwei Guo, Ruosong Ye, Ligong Han, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 视觉定位与Grounding :MLLM(title);grounding(abstract);分类 cs.AI

AI总结 M^3-Bench是首个评估多模态工具使用下模型上下文协议的基准,通过多跳、多线程工作流和可追溯的一对一对应关系,揭示了多模态大语言模型在论点保真度和结构一致性方面的持续差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03071 2026-02-05 cs.CV 79%

Finding Optimal Video Moment without Training: Gaussian Boundary Optimization for Weakly Supervised Video Grounding

无需训练即可找到最优视频片段:用于弱监督视频定位的高斯边界优化

Sunoh Kim, Kimin Yun, Daeho Um

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出GBO方法,通过解决优化问题提升弱监督视频定位的定位性能,无需训练且兼容多种提案架构。

Comments Accepted in IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03892 2026-02-05 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 75%

Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation

分段后审计:用于语言指代音频视频分段的无参考掩码质量评估

Jinxing Zhou, Yanghao Zhou, Yaoting Wang, Zongyan Han, Jiaqi Ma, Henghui Ding, Rao Muhammad Anwer, Hisham Cholakkal

机构 * MBZUAI National University of Singapore(国立新加坡大学) Fudan University(复旦大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究提出 MQA-RefAVS 任务,通过多模态大语言模型评估语言指代音频视频分段中掩码质量,提升分割准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04304 2026-02-05 cs.CV cs.AI cs.CL 73%

Beyond Static Cropping: Layer-Adaptive Visual Localization and Decoding Enhancement

超越静态裁剪:层适应的视觉定位与解码增强

Zipeng Zhu, Zhanghao Hu, Qinglin Zhu, Yuxi Hong, Yijun Liu, Jingyong Su, Yulan He, Lin Gui

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) King’s College London(伦敦大学国王学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LASER方法,通过动态层适应提升视觉定位和解码精度,解决静态裁剪在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04047 2026-02-05 cs.HC 71%

From Crafting Text to Crafting Thought: Grounding AI Writing Support to Writing Center Pedagogy

从文本创作到思维创作:将AI写作支持 grounded 到写作中心教学法

Yijun Liu, John Gallagher, Sarah Sterman, Tal August

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出Writor工具,旨在通过目标设定、平衡反馈和对话来支持写作,而非直接生成文本,以促进学生批判性思维和保留其声音。

Comments Conditionally accepted to CHI 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04486 2026-02-05 cs.CL 67%

Beyond Unimodal Shortcuts: MLLMs as Cross-Modal Reasoners for Grounded Named Entity Recognition

超越单模态捷径:MLLMs作为跨模态推理器用于 grounded 命名实体识别

Jinlong Ma, Yu Zhang, Xuefeng Bai, Kehai Chen, Yuwei Wang, Zeming Liu, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)

AI总结 本文提出MCR方法,通过多风格推理模式注入和约束引导的可验证优化,解决MLLMs在跨模态推理中的模态偏见问题,提升 grounded 命名实体识别的性能。

Comments GMNER

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04518 2026-02-05 cs.CY cs.AI cs.LG 62%

Learning the Value Systems of Agents with Preference-based and Inverse Reinforcement Learning

基于偏好和逆强化学习的学习代理价值系统

Andrés Holgado-Sánchez, Holger Billhardt, Alberto Fernández, Sascha Ossowski

机构 * Universidad Rey Juan Carlos(雷乌安卡洛斯大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于偏好和逆强化学习的方法,用于自动从观察和人类示范中学习代理的价值系统,以解决不同用户价值系统差异带来的协议一致性问题。

Comments 42 pages, 5 figures. Published in Journal of Autonomous Agents and Multi-Agent Systems

Journal ref Holgado-Sánchez, A., Billhardt, H., Fernández, A., Ossowski, S. Learning the value systems of agents with preference-based and inverse reinforcement learning. Autonomous Agents Multi-Agent Systems 40, 4 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26275 2026-02-05 cs.SE cs.AI cs.ET cs.LG cs.MA 62%

A Research Roadmap for Augmenting Software Engineering Processes and Software Products with Generative AI

生成人工智能增强软件工程过程和软件产品的研究路线图

Domenico Amalfitano, Andreas Metzger, Marco Autili, Tommaso Fulcini, Tobias Hey, Jan Keim, Patrizio Pelliccione, Vincenzo Scotti, Anne Koziolek, Raffaela Mirandola, Andreas Vogelsang

机构 * University of Naples "Federico II" Napoli Italy Ruhr Institute for Software Technology (paluno), University of Duisburg-Essen Essen Germany Karlsruhe Institute of Technology (KIT) Karlsruhe Germany Gran Sasso Science Institute (GSSI) L'Aquila Italy University of Naples "Federico II" Ruhr Institute for Software Technology (paluno), University of Duisburg-Essen Karlsruhe Institute of Technology (KIT) Gran Sasso Science Institute (GSSI)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个生成人工智能增强软件工程的路线图,通过多轮过程整合证据,系统分析生成人工智能对软件工程过程、方法和工具的影响,并确定未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01733 2026-02-05 cs.HC cs.AI cs.CV 62%

DISCOVER: Identifying Patterns of Daily Living in Human Activities from Smart Home Data

DISCOVER: 从智能家庭数据中识别日常生活的活动模式

Alexander Karpekov, Archith Iyer, Sourish Gunesh Dhekane, Sonia Chernova, Thomas Plötz

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 DISCOVER通过自监督学习和可视化接口,从智能家庭数据中发现日常活动模式,以更细粒度和个性化的方式识别居民行为,为健康监测和认知退化研究提供新方法。

Comments v2: Re-submission. Under review at IMWUT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04731 2026-02-05 cs.CL cs.LG 57%

Less Finetuning, Better Retrieval: Rethinking LLM Adaptation for Biomedical Retrievers via Synthetic Data and Model Merging

更少微调,更好检索:通过合成数据和模型合并重新思考LLM适应于生物医学检索器

Sameh Khattab, Jean-Philippe Corbeil, Osman Alperen Koraş, Amin Dada, Julian Friedrich, François Beaulieu, Paul Vozila, Jens Kleesiek

机构 * IKIM, University Hospital Essen(IKIM,埃森大学医院) Microsoft Healthcare & Life Sciences(微软医疗与生命科学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出STM框架,通过合成数据和模型合并提升生物医学检索性能,实验显示在任务特定专家上提升23.5%并优于基线模型。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03974 2026-02-05 cs.AI 57%

Active Epistemic Control for Query-Efficient Verified Planning

主动认知控制用于查询高效的验证规划

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 主动认知控制通过结合基于模型的信念管理和范畴可行性检查,实现查询高效的验证规划,在交互环境中减少重新规划轮次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02164 2026-02-05 cs.LG cs.CR 57%

Co-RedTeam: Orchestrated Security Discovery and Exploitation with LLM Agents

Co-RedTeam: 基于LLM代理的协同安全发现与利用

Pengfei He, Ash Fox, Lesly Miculicich, Stefan Friedli, Daniel Fabian, Burak Gokturk, Jiliang Tang, Chen-Yu Lee, Tomas Pfister, Long T. Le

机构 * Google(谷歌) Google Cloud AI Research(谷歌云人工智能研究) Michigan State University(密歇根州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 Co-RedTeam通过整合安全知识、代码分析和执行反馈,提升漏洞发现与利用的自动化水平,实现超过60%的漏洞利用成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04450 2026-02-05 cs.HC 50%

Can Theory-Informed Message Framing Drive Honest and Motivated Performance with Better Assessment Experiences in a Remote Assessment?

基于理论的信息框架能否通过更好的评估体验促进诚实和有动力的表现?

Suvadeep Mukherjee, Björn Rohles, Gabriele Lenzini, Pedro Cardoso-Leite

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究通过基于理论的信息框架减少作弊,同时保持表现和体验,发现不同理论概念的信息效果相似,且支持性动机干预更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19056 2026-02-05 math.AT 50%

Relative Obstructions and Spectral Diagnostics for Sheaves on Cell Complexes

相对障碍与谱诊断:关于细胞复形上sheaves的分析

Shinobu Yokoyama

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种基于sheaf理论和谱分析的框架,用于评估结构不一致的相对障碍,通过谱特征识别不一致的性质和位置。

Comments 26 pages, 5 figures. Presented at the Finland-Japan Workshop in Industrial and Applied Mathematics 2026. v2: Corrected the proof of Proposition 1 (geometric vs. translated mapping cone), simplified the definition of global spectral witnesses, removed an unnecessary variational lemma, and cleaned up notation and references

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 文档图表理解 2 篇

2601.21639 2026-02-05 cs.CV 79%

OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models

OCRVerse: 向端到端视觉语言模型中的整体OCR迈进

Yufeng Zhong, Lei Chen, Xuanle Zhao, Wenkang Han, Liming Zheng, Jing Huang, Deyang Jiang, Yilin Cao, Lin Ma, Zhixiong Zeng

机构 * Meituan(美团)

专题命中 文档图表理解 :vision-language model(title);vision language model(abstract);分类 cs.CV

AI总结 OCRVerse是一种端到端的全面OCR方法,通过多领域训练实现文本和视觉导向OCR的统一,提升跨领域数据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04365 2026-02-05 cs.LG 70%

EXaMCaP: Subset Selection with Entropy Gain Maximization for Probing Capability Gains of Large Chart Understanding Training Sets

EXaMCaP: 通过熵增最大化进行子集选择以探测大规模图表理解训练集的探测能力提升

Jiapeng Liu, Liang Li, Bing Li, Peng Fu, Xiyan Gao, Chengyang Fang, Xiaoshuai Hao, Can Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyberspace Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) School of Computer and Artificial Intelligence, Jiangxi University of Finance and Economics(江西财经大学计算机与人工智能学院)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

AI总结 EXaMCaP通过熵增最大化选择子集,以高效探测大规模图表理解训练集的能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 3 篇

2512.22208 2026-02-05 cs.CL cs.CV cs.LG 81%

Open-Source Multimodal Moxin Models with Moxin-VLM and Moxin-VLA

开源多模态Moxin模型:Moxin-VLM和Moxin-VLA

Pu Zhao, Arash Akbari, Xuan Shen, Zhenglun Kong, Yixin Shen, Sung-En Chang, Timothy Rupprecht, Lei Lu, Enfu Nan, Changdi Yang, Yumei He, Weiyan Shi, Xingchen Xu, Yu Huang, Wei Jiang, Wei Wang, Yue Chen, Yong He, Yanzhi Wang

机构 * Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Futurewei(未来通信) AIBAO LLC

专题命中 GUI与屏幕智能体 :VLM(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出开源多模态Moxin模型,通过Moxin-VLM、Moxin-VLA和Moxin-Chinese三种变体,提升视觉-语言、视觉-语言-动作及中文任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03973 2026-02-05 cs.RO cs.CV 79%

VLS: Steering Pretrained Robot Policies via Vision-Language Models

VLS:通过视觉-语言模型引导预训练的机器人策略

Shuo Liu, Ishneet Sukhvinder Singh, Yiqing Xu, Jiafei Duan, Ranjay Krishna

机构 * University of Washington(华盛顿大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV

AI总结 VLS通过视觉-语言模型在推理时引导预训练机器人策略,实现无需训练的适应,提升在不同环境下的表现。

Comments 11 Pages, Project page: https://vision-language-steering.github.io/webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏