arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-02 至 2026-02-02 共收录 52 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2601.22398 2026-02-02 cs.CV cs.AI 84%

Jailbreaks on Vision Language Model via Multimodal Reasoning

通过多模态推理实现对视觉语言模型的逃逸攻击

Aarush Noheria, Yuguang Yao

机构 * Novi High School, MI, USA(诺维高中) Michigan State University, MI, USA(密歇根州立大学)

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于多模态推理的逃逸攻击框架,通过训练后链式推理和自适应噪声机制提高对视觉语言模型的安全过滤器的绕过能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22483 2026-02-02 cs.CV 81%

Head-Aware Visual Cropping: Enhancing Fine-Grained VQA with Attention-Guided Subimage

头感知视觉裁剪:通过注意力引导的子图像增强细粒度VQA

Junfei Xie, Peng Pan, Xulong Zhang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract)

AI总结 通过注意力引导的子图像增强细粒度VQA,提出无需训练的HAVC方法,利用优化的注意力头提升视觉定位精度。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22570 2026-02-02 cs.CV cs.LG 73%

Leveraging Data to Say No: Memory Augmented Plug-and-Play Selective Prediction

利用数据说不:基于记忆的插拔式选择预测

Aditya Sarkar, Yi Li, Jiacheng Cheng, Shlok Mishra, Nuno Vasconcelos

机构 * University of Maryland, College Park(马里兰大学) University of California, San Diego(加州大学圣地亚哥分校) Qualcomm AI(高通人工智能) Yale University(耶鲁大学) Meta AI

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 本文提出基于记忆的插拔式选择预测方法,通过增强视觉语言嵌入来减少方差并改进分数校准,提升图像描述、匹配和细粒度分类性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22218 2026-02-02 cs.CV cs.DL 57%

What Lies Beneath: A Call for Distribution-based Visual Question & Answer Datasets

表下之物:对基于分布的视觉问答数据集的呼吁

Jill P. Naiman, Daniel J. Evans, JooYoung Seo

机构 * Information Science(信息科学) University of Illinois(伊利诺伊大学) Urbana-Champaign(厄巴纳-香槟) Illinois, USA(伊利诺伊斯州,美国)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文呼吁建立专门针对科学图表的VQA基准,通过生成合成图表并要求模型基于底层数据回答问题,以解决现有数据集未能捕捉的图表与数据间关系的推理挑战。

Comments Accepted to ACM/IEEE Joint Conference on Digital Libraries JCDL 2025, 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 8 篇

2601.22714 2026-02-02 cs.LG cs.AI cs.CV 82%

Vision-Language Models Unlock Task-Centric Latent Actions

视觉-语言模型解锁任务导向的潜在动作

Alexander Nikulin, Ilya Zisman, Albina Klepach, Denis Tarasov, Alexander Derevyagin, Andrei Polubarov, Lyubaykin Nikita, Vladislav Kurenkov

机构 * Innopolis University(因诺波利斯大学) Research Center for Trusted Artificial Intelligence, ISP RAS(可信人工智能研究所以及ISP俄罗斯科学院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出利用视觉-语言模型的常识推理能力,通过可提示的表示分离可控变化与噪声,提升潜在动作质量,从而提高下游任务性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22959 2026-02-02 cs.CV 79%

Triage: Hierarchical Visual Budgeting for Efficient Video Reasoning in Vision-Language Models

Triage: 分层视觉预算机制用于视觉语言模型中的高效视频推理

Anmin Wang, Nan Zhang, Wei Tao, Xiaoyang Qu, Guokuan Li, Jiguang Wan, Jianzong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 Triage通过分层视觉预算机制优化视频推理,提升效率并保持性能。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25801 2026-02-02 cs.LG cs.AI cs.CL cs.CV 75%

Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start

Metis-SPECS: 通过基于偏好自我蒸馏的冷启动解耦多模态学习

Kun Chen, Peng Shi, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao, Lin Ma

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

专题命中 视觉推理 :vision language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Metis-SPECS通过基于偏好的自我蒸馏冷启动框架解耦多模态学习,提升泛化能力和下游RL表现。

Comments Published as a conference paper at ICLR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16648 2026-02-02 cs.AI cs.CL cs.LG 62%

FESTA: Functionally Equivalent Sampling for Trust Assessment of Multimodal LLMs

FESTA:用于多模态大语言模型信任评估的功能等效采样

Debarpan Bhattacharya, Apoorva Kulkarni, Sriram Ganapathy

机构 * Indian Institute of Science(印度科学研究院) University of Maryland College Park(马里兰大学学院公园分校)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 FESTA通过功能等效采样技术提升多模态大语言模型的预测选择性性能,实现33.3%和29.6%的改进。

Comments Accepted in the Findings of EMNLP, 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25497 2026-02-02 cs.LG 57%

Right for the Right Reasons: Avoiding Reasoning Shortcuts via Prototypical Neurosymbolic AI

为正确的理由而正确:通过原型神经符号AI避免推理捷径

Luca Andolfi, Eleonora Giunchiglia

机构 * Imperial College London(帝国理工学院伦敦分校) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.LG

AI总结 本文提出原型神经符号架构,通过学习正确基本概念避免推理捷径,提升神经符号学习的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22162 2026-02-02 q-fin.GN cs.AI cs.CL 57%

UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos

UniFinEval: 向跨文本、图像和视频的金融多模态模型统一评估迈进

Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin Guo, Rongjunchen Zhang, Liwen Zhang

机构 * SUFE(上海财经大学) Tencent(腾讯) Gatech(佐治亚理工学院) HiThink Research(慧图研究)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 UniFinEval提出首个统一多模态基准,用于评估金融领域高信息密度下的多模态模型能力,通过五个真实金融场景和大规模数据集验证模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23149 2026-02-02 cs.SD 50%

Hearing is Believing? Evaluating and Analyzing Audio Language Model Sycophancy with SYAUDIO

听信还是不信?评估和分析音频语言模型的趋炎附势行为 with SYAUDIO

Junchi Yao, Lokranjan Lakshmikanthan, Annie Zhao, Danielle Zhao, Shu Yang, Zikang Ding, Di Wang, Lijie Hu

机构 * University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) King Abdullah University of Science and Technology(卡布斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 SYAUDIO是首个评估音频语言模型趋炎附势行为的基准,通过系统分析不同领域和条件下的趋炎附势现象,验证了监督微调在减少此类行为中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22735 2026-02-02 cs.CL 50%

MM-THEBench: Do Reasoning MLLMs Think Reasonably?

MM-THEBench: 多模态大语言模型是否能合理推理?

Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

机构 * KIRC, Institute for Artificial Intelligence, Tsinghua University, China(KIRC人工智能研究院,清华大学,中国)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 MM-THEBench旨在评估推理MLLMs在中间推理过程中的幻觉问题,通过细粒度分类和多层次评估框架,揭示思考对多模态任务中幻觉和推理能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 13 篇

2601.22738 2026-02-02 cs.CV 83%

StreamSense: Streaming Social Task Detection with Selective Vision-Language Model Routing

StreamSense: 基于选择性视觉-语言模型路由的流式社交任务检测

Han Wang, Deyi Ji, Lanyun Zhu, Jiebo Luo, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) University of Rochester(罗切斯特大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 StreamSense通过轻量级编码器与选择性路由结合VLM专家,提升流式社交任务检测的准确性和效率。

Comments 10 pages, 4 figures, The Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02662 2026-02-02 cs.LG 80%

Grounding Large Language Models in Interactive Environments with Online Reinforcement Learning

通过在线强化学习将大语言模型接地于交互环境

Thomas Carta, Clément Romac, Thomas Wolf, Sylvain Lamprier, Olivier Sigaud, Pierre-Yves Oudeyer

机构 * Inria (Flowers)(Inria(Flowers)) University of Bordeaux(波尔多大学) Hugging Face Univ Angers, LERIA, SFR MATHSTIC(昂热大学,LERIA,SFR MATHSTIC) Sorbonne Université(索邦大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 本文提出GLAM方法,通过在线强化学习将大语言模型接地于交互环境,以提升样本效率和泛化能力,并探讨在线学习的影响。

Comments The associated code can be found at https://github.com/flowersteam/Grounding_LLMs_with_online_RL. This is an extended version of the paper published at ICML 2023: https://proceedings.mlr.press/v202/carta23a

Journal ref PMLR 202 (2023):3676-3713

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22666 2026-02-02 cs.CV 79%

ExpAlign: Expectation-Guided Vision-Language Alignment for Open-Vocabulary Grounding

ExpAlign:基于期望引导的视觉-语言对齐用于开放词汇接地

Junyi Hu, Tian Bai, Fengyi Wu, Wenyan Li, Zhenming Peng, Yi Zhang

机构 * Department of Automation, Tsinghua University, China(清华大学自动化系) University of Electronic Science and Technology of China, China(电子科技大学) University of Copenhagen, Denmark(哥本哈根大学) Lingsu Lab, China(灵素实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 ExpAlign通过理论指导的多实例学习框架,实现开放词汇接地任务中隐式token和实例选择,提升检测和分割性能,尤其在长尾类别上表现突出。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20433 2026-02-02 cs.CV 79%

MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models

MARE: 多模态对齐与强化学习用于通过视觉-语言模型的可解释深度伪造检测

Wenbo Xu, Wei Lu, Xiangyang Luo, Jiantao Zhou

机构 * School of Computer Science and Engineering, MoE Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-sen University, Guangzhou 510006, China(计算机科学与工程学院,信息技术MOE实验室,广东省信息安全技术重点实验室,中山大学,广州510006,中国) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Department of Computer and Information Science, University of Macau.(计算机与信息科学系,澳门大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 MARE通过多模态对齐和强化学习提升视觉-语言模型在深度伪造检测中的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23129 2026-02-02 cs.CL 78%

Evaluating the Utility of Grounding Documents with Reference-Free LLM-based Metrics

评估基于参考-free LLM的文档接地的效用

Yilun Hua, Giuseppe Castellucci, Peter Schulam, Heba Elfardy, Kevin Small

机构 * Department of Computer Science and Cornell Tech, Cornell University(计算机科学系和Cornell Tech,康奈尔大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文提出GroGU,一种无需注释的模型特定指标,用于评估RAG中文档接地的效用,通过优化查询重写器提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20835 2026-02-02 cs.CV cs.AI 62%

Open-Vocabulary Functional 3D Human-Scene Interaction Generation

开放词汇功能3D人类-场景交互生成

Jie Liu, Yu Sun, Alpar Cseke, Yao Feng, Nicolas Heron, Michael J. Black, Yan Zhang

机构 * Meshcapade University of Amsterdam(阿姆斯特丹大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 FunHSI通过功能驱动框架生成开放词汇任务下的功能正确3D人类-场景交互。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01706 2026-02-02 cs.CL cs.AI cs.LG 62%

Multi-Step Knowledge Interaction Analysis via Rank-2 Subspace Disentanglement

通过秩-2子空间解耦进行多步知识交互分析

Sekh Mainul Islam, Pepa Atanasova, Isabelle Augenstein

机构 * Department of Computer Science, University of Copenhagen, Copenhagen, Denmark(计算机科学系,哥本哈根大学,哥本哈根,丹麦)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种秩-2子空间方法,用于多步分析NLE中的知识交互,揭示PK和CK在不同生成中的对齐特性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22164 2026-02-02 cs.CV cs.LG cs.RO 62%

Do Open-Vocabulary Detectors Transfer to Aerial Imagery? A Comparative Evaluation

开放词汇检测器能否迁移到航拍图像?一项比较评估

Christos Tsourveloudis

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(电气与计算机工程学院,国家技术大学雅典)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文评估了开放词汇检测器在航拍图像上的迁移能力,发现语义混淆是主要瓶颈,且不同数据集表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23281 2026-02-02 cs.CV 57%

User Prompting Strategies and Prompt Enhancement Methods for Open-Set Object Detection in XR Environments

面向XR环境的开放集目标检测中的用户提示策略与提示增强方法

Junfeng Lin, Yanming Xiu, Maria Gorlatova

机构 * Department of Electrical and Computer Engineering, Duke University(电子工程系,杜克大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出针对XR环境中的开放集目标检测,通过研究用户提示策略和增强方法,提升模型在模糊提示下的鲁棒性,实验结果显示提示增强可使mIoU提升超过55%。

Comments Accepted by IEEE VR 2026: GenAI-XR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23206 2026-02-02 cs.AI 57%

High-quality generation of dynamic game content via small language models: A proof of concept

通过小型语言模型实现高质量动态游戏内容生成:概念验证

Morten I. K. Munk, Arturo Valdivia, Paolo Burelli

机构 * brAIn lab\ University of Copenhagen Copenhagen Denmark \&\ Power Labs Copenhagen Denmark Data Science Section\ University of Copenhagen Copenhagen Denmark brAIn lab\ University of Copenhagen \&\ Power Labs Data Science Section\ University of Copenhagen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出通过激进微调小型语言模型生成高质量动态游戏内容的方法,并通过概念验证展示其在实时生成中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17233 2026-02-02 cs.LG stat.AP stat.ME 57%

Hybrid$^2$ Neural ODE Causal Modeling and an Application to Glycemic Response

混合$^2$神经ODE因果建模及其在糖化反应中的应用

Bob Junyi Zou, Matthew E. Levine, Dessi P. Zaharieva, Ramesh Johari, Emily B. Fox

机构 * Institute for Computational and Mathematical Engineering, Stanford University(计算与数学工程研究所,斯坦福大学) Broad Institute of MIT and Harvard(哈佛大学与麻省理工学院Broad研究所) Department of Pediatrics, Stanford University(斯坦福大学儿科系) Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系) Department of Statistics and Department of Computer Science, Stanford University(斯坦福大学统计系与计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出了一种混合神经ODE模型,通过引入因果损失来提升因果有效性,应用于1型糖尿病患者运动后葡萄糖动态建模,实现预测性能与因果有效性的双赢。

Journal ref Proceedings of the 41st International Conference on Machine Learning, PMLR 235:62934-62963, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22305 2026-02-02 cs.LG 57%

BayesFlow: A Probability Inference Framework for Meta-Agent Assisted Workflow Generation

BayesFlow: 一个用于元代理辅助工作流生成的概率推断框架

Bo Yuan, Yun Zhou, Zhichao Xu, Kiran Ramnath, Aosong Feng, Balasubramaniam Srinivasan

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon Web Services AI Lab(亚马逊网络服务人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 BayesFlow通过贝叶斯推断和并行前瞻滚动实现工作流生成的原理性改进,提升准确性达9-65个百分点。

Comments EACL 2026 Finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22284 2026-02-02 cs.LG 57%

Riemannian Lyapunov Optimizer: A Unified Framework for Optimization

Riemannian Lyapunov Optimizer:一种优化的统一框架

Yixuan Wang, Omkar Sudhir Patil, Warren E. Dixon

机构 * Department of Mechanical and Aerospace Engineering(机械与航空航天工程系) University of Florida(佛罗里达大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 Riemannian Lyapunov Optimizer通过控制理论框架统一优化算法,提供稳定有效的优化器设计方法。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 3 篇

2512.01017 2026-02-02 cs.AI 83%

ChartAnchor: Chart Grounding with Structural-Semantic Fidelity

ChartAnchor: 图表接地与结构-语义保真

Xinhang Li, Jingbo Zhou, Pengfei Luo, Yixiong Xiao, Tong Xu

机构 * Baidu Research(百度研究) USTC

专题命中 文档图表理解 :grounding(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 ChartAnchor提出一个综合图表接地基准测试,通过图表到代码生成和受控表格重建任务,评估模型在结构和数值层面的保真度,揭示MLLMs在数值精度和代码合成方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22754 2026-02-02 cs.CV cs.AI 81%

Procedural Knowledge Extraction from Industrial Troubleshooting Guides Using Vision Language Models

从工业故障排除指南中提取程序性知识:使用视觉语言模型

Guillermo Gil de Avalle, Laura Maruster, Christos Emmanouilidis

机构 * University of Groningen(Groningen大学)

专题命中 文档图表理解 :vision language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究如何利用视觉语言模型从工业故障排除指南中提取结构化知识,通过对比两种提示策略评估模型性能,揭示布局敏感性与语义稳健性的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12243 2026-02-02 cs.CV cs.AI 62%

Less is More: Label-Guided Summarization of Procedural and Instructional Videos

少即是多:基于标签的程序性和教学视频摘要

Shreya Rajpal, Michal Golovanevsky, Carsten Eickhoff

机构 * University of Tübingen(图宾根大学) Vellore Institute of Technology(维洛雷理工学院) Brown University(布朗大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 PRISM提出了一种基于标签的视频摘要方法,通过集成语义和多模态分析,生成语义准确且上下文连贯的摘要,有效提升摘要质量。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 6 篇

2601.22701 2026-02-02 cs.AI 83%

Best-of-Q: Improving VLM agents with Q-function Action Ranking at Inference

Best-of-Q: 通过推理中的Q函数动作排名提升VLM代理

Emilien Biré, María Santos, Kai Yuan

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 Best-of-Q通过在推理过程中利用Q函数动作排名提升VLM代理性能,显著提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22528 2026-02-02 cs.AI 70%

Darwinian Memory: A Training-Free Self-Regulating Memory System for GUI Agent Evolution

达尔文记忆:一种无训练的自调节记忆系统用于GUI代理进化

Hongze Mi, Yibo Feng, WenJie Lu, Song Cao, Jinyuan Li, Yanming Li, Xuelin Zhang, Haotian Luo, Songyang Peng, He Cui, Tengfei Tian, Jun Fang, Hua Chai, Naiqiang Tan

机构 * Didichuxing Co. Ltd(滴滴出行有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tianjin University(天津大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 达尔文记忆系统通过自进化架构提升GUI代理的执行稳定性与成功率,无需额外训练或架构开销。

详情

展开后加载摘要…

URL PDF HTML 收藏