arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-27 至 2025-11-27 共收录 43 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2511.21339 2025-11-27 cs.CV cs.AI 84%

SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding

SurgMLLMBench: 一个用于手术场景理解的多模态大语言模型基准数据集

Tae-Min Choi, Tae Kyeong Jeong, Garam Kim, Jaemin Lee, Yeongyoon Koh, In Cheul Choi, Jae-Ho Chung, Jong Woong Park, Juyoun Park

机构 * Samsung Research(三星研究所) Center for Humanoid Research, Korea Institute of Science and Technology(人类研究学院,韩国科学技术院) Department of plastic surgery, College of medicine, Korea University(医学院整形外科部,韩国大学) Department of orthopedic surgery, College of medicine, Korea University(医学院骨科部,韩国大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 SurgMLLMBench是一个用于手术场景理解的多模态大语言模型基准数据集,整合了像素级分割和结构化VQA注释,支持跨领域的全面评估和更丰富的视觉-对话交互。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21191 2025-11-27 cs.CV 77%

Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding

场景作为标记:多尺度正常分布变换标记器用于通用3D视觉-语言理解

Yutao Tang, Cheng Zhao, Gaurav Mittal, Rohith Kukkala, Rama Chellappa, Cheng Peng, Mei Chen

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软公司)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

AI总结 NDTokenizer3D通过多尺度NDT表示和解码器实现通用3D视觉-语言理解,提升3D场景任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20937 2025-11-27 cs.AI cs.CL cs.CV cs.RO 73%

ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction

ENACT:通过视角交互的世界建模评估具身认知

Qineng Wang, Wenlong Huang, Yu Zhou, Hang Yin, Tianwei Bao, Jianwen Lyu, Weiyu Liu, Ruohan Zhang, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) UCLA(加州大学洛杉矶分校)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 ENACT通过视角交互的世界建模评估具身认知,揭示VLMs在长周期交互中与人类表现差距扩大,且模型在逆向任务中表现更优。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14914 2025-11-27 cs.CV cs.CL cs.LG 62%

CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness

CAPability: 一个全面的视觉描述基准,用于评估正确性和全面性

Zhihang Liu, Chen-Wei Xie, Bin Wen, Feiwu Yu, Jixuan Chen, Pandeng Li, Boqiang Zhang, Nianzu Yang, Yinglu Li, Zuan Gao, Yun Zheng, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 CAPability是一个全面的视觉描述基准,通过12个维度评估描述的正确性和全面性,利用人类标注数据和启发式指标提升多模态模型的描述能力分析。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20940 2025-11-27 cs.CL 50%

Chatty-KG: A Multi-Agent AI System for On-Demand Conversational Question Answering over Knowledge Graphs

Chatty-KG:一种用于基于知识图谱的按需对话问答的多智能体AI系统

Reham Omar, Abdelghny Orogat, Ibrahim Abdelaziz, Omij Mangukiya, Panos Kalnis, Essam Mansour

机构 * Concordia University(康科德大学) IBM Research(IBM研究院)

专题命中 视觉问答 :grounding(abstract)

AI总结 Chatty-KG通过多智能体系统实现基于知识图谱的对话问答,结合RAG检索与结构化执行,提升多轮问答的准确性和效率。

Comments This paper is accepted to SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 7 篇

2511.00396 2025-11-27 cs.CV 83%

Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning

Saliency-R1: 通过置信度引导的强化学习激励多模态大语言模型统一的显著性推理能力

Long Li, Shuichen Ji, Ziyang Luo, Zhihui Li, Dingwen Zhang, Junwei Han, Nian Liu

机构 * Northwestern Polytechnical University(西北工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 Saliency-R1通过置信度引导的强化学习,提升多模态大语言模型在显著性推理任务中的统一能力,实现显著物体检测、显著实例分割和共显著物体检测的高效处理。

Comments Main text (excluding references): 8 pages, 4 figures; Supplementary Materials (excluding references): 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20795 2025-11-27 cs.CV cs.AI 81%

Revisiting KRISP: A Lightweight Reproduction and Analysis of Knowledge-Enhanced Vision-Language Models

重新审视 KRISP:一种轻量级的知识增强视觉-语言模型的再现与分析

Souradeep Dutta, Keshav Bulia, Neena S Nair

机构 * Centre For Digital Health(数字健康中心) Indian Institute of Technology Bombay(孟买印度理工学院) Department of Metallurgical engineering & Material science(冶金工程与材料科学系) Department of Bioscience & Bioengineering(生物科学与生物工程系)

专题命中 视觉推理 :vision-language model(title);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本研究重新审视 KRISP,通过轻量级模型揭示知识增强 VQA 的设计缺陷与资源受限下的有效性。

Comments 7 pages , 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21042 2025-11-27 cs.CV 70%

LungNoduleAgent: A Collaborative Multi-Agent System for Precision Diagnosis of Lung Nodules

LungNoduleAgent: 一种用于肺结节精准诊断的协作多智能体系统

Cheng Yang, Hui Jin, Xinlei Yu, Zhipeng Wang, Yaoqun Liu, Fenglei Fan, Dajiang Lei, Gangyong Jia, Changmiao Wang, Ruiquan Ge

专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 LungNoduleAgent通过协作多智能体系统提升肺结节诊断的精度与效率

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19900 2025-11-27 cs.CV cs.AI 62%

Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning

Agent0-VL: 探索自我进化代理用于工具集成的视觉-语言推理

Jiaqi Liu, Kaiwen Xiong, Peng Xia, Yiyang Zhou, Haonian Ji, Lu Feng, Siwei Han, Mingyu Ding, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 Agent0-VL通过工具集成推理实现自我进化,无需人类标注或外部奖励,提升视觉-语言推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20351 2025-11-27 cs.CV 57%

Thinking in 360°: Humanoid Visual Search in the Wild

全方位思考:野外人形视觉搜索

Heyang Yu, Yinan Han, Xiangyu Zhang, Baiqiao Yin, Bowen Chang, Xiangyu Han, Xinhao Liu, Jing Zhang, Marco Pavone, Chen Feng, Saining Xie, Yiming Li

机构 * NYU(纽约大学) NVIDIA(英伟达) TU Darmstadt(图鲁姆大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 本文提出人形视觉搜索方法,通过人形代理在360°全景图像中搜索物体和路径,实验表明现有模型在复杂场景中表现不佳,但通过后训练技术显著提升了性能。

Comments Website: https://humanoid-vstar.github.io/ ; Code: https://github.com/humanoid-vstar/hstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19278 2025-11-27 cs.CV 57%

ReMatch: Boosting Representation through Matching for Multimodal Retrieval

ReMatch: 通过匹配提升表示以实现多模态检索

Qianying Liu, Xiao Liang, Zhiqiang Zhang, Zhongfei Qing, Fengfan Zhou, Yibo Chen, Xu Tang, Yao Hu, Paul Henderson

机构 * University of Glasgow(格拉斯哥大学) Xiaohongshu Inc.(小红书公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 ReMatch通过生成匹配阶段提升多模态检索的表示能力,利用端到端训练和细粒度嵌入生成,在MMEB基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21402 2025-11-27 cs.CL 50%

Text-to-SQL as Dual-State Reasoning: Integrating Adaptive Context and Progressive Generation

文本到SQL作为双状态推理:整合自适应上下文和渐进生成

Zhifeng Hao, Qibin Song, Ruichu Cai, Boyan Xu

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机科学学院) College of Science, Shantou University(汕头大学科学学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 视觉推理 :grounding(abstract)

AI总结 DSR-SQL通过双状态推理框架整合自适应上下文和渐进生成,提升文本到SQL的执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 12 篇

2511.21375 2025-11-27 cs.CV 85%

Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning

通过边界框思考:通过强化微调提升空间时间视频定位

Xin Gu, Haoji Zhang, Qihang Fan, Jingxuan Niu, Zhipeng Zhang, Libo Zhang, Guang Chen, Fan Chen, Longyin Wen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 STVG-o1通过强化微调提升空间时间视频定位性能,实现无需架构修改的先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19516 2025-11-27 cs.CV 85%

Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning

连接点:通过代理推理实现无需训练的视觉接地

Liqin Luo, Guangyao Chen, Xiawu Zheng, Yongxing Dai, Yixiong Zou, Yonghong Tian

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 GroundingAgent通过代理推理实现无需微调的视觉接地,达到65.1%的零样本准确率,并在选择阶段实现90%的准确率,展示了LLM推理能力的重要性。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02607 2025-11-27 cs.CV cs.CL 83%

UniChange: Unifying Change Detection with Multimodal Large Language Model

UniChange: 通过多模态大语言模型统一变化检测

Xu Zhang, Danyang Li, Xiaohang Dong, Tianhao Wu, Hualong Yu, Jianye Wang, Qicheng Li, Xiang Li

机构 * TMCC, Computer Science, Nankai University(天津大学计算机学院,南开大学) VCIP, Computer Science, Nankai University(南开大学计算机科学系) NKIARI, Futian, Shenzhen(深圳福田国家工程研究中心) CMEE, Sichuan Agricultural University(四川农业大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 UniChange通过多模态大语言模型统一变化检测任务,引入特殊标记和文本提示,实现BCD和SCD的统一,并在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19111 2025-11-27 cs.CV 70%

DiffSeg30k: A Multi-Turn Diffusion Editing Benchmark for Localized AIGC Detection

DiffSeg30k: 一种用于局部AIGC检测的多轮扩散编辑基准

Hai Ci, Ziheng Peng, Pei Yang, Yingxin Xuan, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) South China University of Technology(华南理工大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 DiffSeg30k通过引入多轮扩散编辑基准,推动AIGC检测从二元分类到语义分割的转变,提升局部编辑定位和模型识别的可靠性。

Comments 16 pages, 10 figures; typos corrected, references added

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20841 2025-11-27 cs.RO 67%

OVAL-Grasp: Open-Vocabulary Affordance Localization for Task Oriented Grasping

OVAL-Grasp:面向任务的开放词汇表征定位抓取

Edmond Tong, Advaith Balaji, Anthony Opipari, Stanley Lewis, Zhen Zeng, Odest Chadwicke Jenkins

机构 * University of Michigan, Ann Arbor, MI, USA(密歇根大学) J.P. Morgan AI Research(摩根大通AI研究)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 OVAL-Grasp通过结合大语言模型和视觉-语言模型,实现面向任务的开放词汇表征抓取,有效识别物体部分并提高抓取成功率。

Comments 10 pages, 7 figures, 3 tables. Presented at the 2025 International Symposium on Experimental Robotics (ISER)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21337 2025-11-27 cs.CV cs.AI 62%

Hybrid SIFT-SNN for Efficient Anomaly Detection of Traffic Flow-Control Infrastructure

混合SIFT-SNN用于交通流控制基础设施异常检测的高效方法

Munish Rathee, Boris Bačić, Maryam Doborjeh

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出混合SIFT-SNN框架,通过空间特征编码与低延迟脉冲神经网络实现交通基础设施异常检测的高效实时处理。

Comments 8 pages, 6 figures. This is a preprint of a paper accepted for presentation at the 2025 International Conference on Image and Vision Computing New Zealand (IVCNZ). The final version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21002 2025-11-27 cs.CV cs.AI 62%

Knowledge Completes the Vision: A Multimodal Entity-aware Retrieval-Augmented Generation Framework for News Image Captioning

知识完善视觉:一种多模态实体感知检索增强生成框架用于新闻图像描述

Xiaoxing You, Qiang Huang, Lingyu Li, Chi Zhang, Xiaopeng Liu, Min Zhang, Jun Yu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 MERGE提出了一种多模态实体感知检索增强生成框架,通过构建实体中心知识库和改进跨模态对齐,提升新闻图像描述质量和命名实体识别性能。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17464 2025-11-27 cs.LG cs.AI stat.ML 62%

Data Valuation by Fusing Global and Local Statistical Information

通过融合全局和局部统计信息进行数据估值

Xiaoling Zhou, Ou Wu, Michael K. Ng, Hao Jiang

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Hong Kong Baptist University(香港 Baptist大学) Renmin University of China(中国人民大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出融合全局和局部统计信息的增强数据估值方法,通过正则化项优化Shapley值估计,并引入动态数据估值技术提升计算效率。

Comments 35 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21066 2025-11-27 cs.CL cs.AI 57%

Context-Aware Pragmatic Metacognitive Prompting for Sarcasm Detection

面向上下文的元认知修辞提示用于讽刺检测

Michael Iskandardinata, William Christian, Derwin Suhartono

机构 * Computer Science Department(计算机科学系) School of Computer Science(计算机科学学院) Bina Nusantara University(宾努斯大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种基于检索的元认知修辞提示方法,通过整合上下文信息提升LLMs在讽刺检测中的性能,实验显示在多个数据集上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20957 2025-11-27 cs.CV 57%

Beyond Realism: Learning the Art of Expressive Composition with StickerNet

超越现实:利用StickerNet学习表现性创作

Haoming Lu, David Kocharian, Humphrey Shi

机构 * Picsart AI Research(Picsart人工智能研究) Picsart Inc(Picsart公司) College of Computing(计算学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 StickerNet通过学习真实世界编辑模式,实现了表现性图像合成,超越传统真实感追求,提升艺术性和用户意图的表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18513 2025-11-27 cs.LG 57%

Enhancing Training Data Attribution with Representational Optimization

通过表征优化增强训练数据归因

Weiwei Sun, Haokun Liu, Nikhil Kandpal, Colin Raffel, Yiming Yang

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 AirRep通过优化表征提升训练数据归因效率,实现与先进梯度方法相当的性能,且推理效率提高近两数量级。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21157 2025-11-27 cs.HC 50%

QuadStretcher: A Forearm-Worn Skin Stretch Display for Bare-Hand Interaction in AR/VR

QuadStretcher:一种可穿戴皮肤拉伸显示装置用于AR/VR中的裸手交互

Taejun Kim, Youngbo Aram Shim, Youngin Kim, Sunbum Kim, Jaeyeon Lee, Geehyuk Lee

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 QuadStretcher通过前臂皮肤拉伸显示技术,实现了裸手交互中的触觉反馈,提升了AR/VR沉浸感。

Comments ACM CHI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 3 篇

2509.22283 2025-11-27 cs.CV 74%

Rule-Based Reinforcement Learning for Document Image Classification with Vision Language Models

基于规则的强化学习用于文档图像分类与视觉语言模型

Michael Jungo, Andreas Fischer

机构 * University of Applied Sciences and Arts Western Switzerland(西瑞士应用艺术大学) University of Fribourg(弗里堡大学)

专题命中 文档图表理解 :vision language model(title);分类 cs.CV

AI总结 本文提出基于规则的强化学习方法,用于提升文档图像分类任务的泛化能力,通过不同场景验证其在处理超出分布数据时的优势。

Comments Code available at https://github.com/jungomi/vision-finetune

Journal ref Document Analysis and Recognition - ICDAR 2025 Workshops. pp. 292-309. Cham: Springer Nature Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03928 2025-11-27 cs.CV 70%

Vision Remember: Recovering Visual Information in Efficient LVLM with Vision Feature Resampling

Vision Remember: 在高效的LVLM中通过视觉特征采样恢复视觉信息

Ze Feng, Jiang-jiang Liu, Sen Yang, Lingyu Xiao, Zhibin Quan, Zhenhua Feng, Wankou Yang, Jingdong Wang

机构 * Southeast University(东南大学) Baidu VIS(百度视觉) The University of Hong Kong(香港大学) Jiangnan University(江南大学)

专题命中 文档图表理解 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 Vision Remember通过视觉特征采样在高效LVLM中恢复视觉信息,提升效率并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12307 2025-11-27 cs.CV cs.CL 57%

LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?

LogicOCR: 大型多模态模型在文本丰富的图像上逻辑推理是否表现优异?

Maoyuan Ye, Haibin He, Qihuang Zhong, Jing Zhang, Juhua Liu, Bo Du

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(计算机学院、多媒体软件国家工程研究中心、人工智能研究院、多媒体与网络通信工程湖北省重点实验室、武汉大学)

专题命中 文档图表理解 :LLaVA(abstract);分类 cs.CV

AI总结 LogicOCR通过构建包含生成和现实图像问题的基准测试,评估大型多模态模型在文本丰富图像上的逻辑推理能力,并提出TextCue方法提升模型对关键文本区域的感知。

Comments GitHub: https://github.com/MiliLab/LogicOCR

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 4 篇

2505.15277 2025-11-27 cs.CL 67%

Web-Shepherd: Advancing PRMs for Reinforcing Web Agents

Web-Shepherd: 促进强化网络代理的PRMs

Hyungjoo Chae, Sunghwan Kim, Junhee Cho, Seungone Kim, Seungjun Moon, Gyeom Hwangbo, Dongha Lim, Minjin Kim, Yeonjun Hwang, Minju Gwak, Dongwook Choi, Minseok Kang, Gwanhoon Im, ByeongUng Cho, Hyojun Kim, Jun Hee Han, Taeyoon Kwon, Minju Kim, Beong-woo Kwak, Dongjin Kang, Jinyoung Yeo

机构 * Georgia Institute of Technology(佐治亚理工学院) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)

AI总结 Web-Shepherd是首个用于强化网络代理的PRM,通过构建大规模数据集和元评估基准,提升了网络导航任务的准确性和效率。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21398 2025-11-27 cs.AI cs.CL cs.HC cs.MA 57%

Prune4Web: DOM Tree Pruning Programming for Web Agent

Prune4Web: 面向Web代理的DOM树剪枝编程

Jiayuan Zhang, Kaiquan Chen, Zhihao Lu, Enshen Zhou, Qian Yu, Jing Zhang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 Prune4Web通过DOM树剪枝编程提升Web自动化精度,实现25-50倍候选元素减少,显著提高接地任务准确性至88.28%。

Comments Paper accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21202 2025-11-27 cs.CV 57%

Towards an Effective Action-Region Tracking Framework for Fine-grained Video Action Recognition

迈向细粒度视频动作识别的有效动作-区域跟踪框架

Baoli Sun, Yihan Wang, Xinzhu Ma, Zhihui Wang, Kun Lu, Zhiyong Wang

机构 * DUT-RU International School of Information Science & Engineering, Dalian University of Technology, China(大连理工大学国际信息科学与工程学院,大连理工大学,中国) Beihang University, China(北京航空航天大学,中国) The University of Sydney, Australia(悉尼大学,澳大利亚)

专题命中 GUI与屏幕智能体 :visual language model(abstract);分类 cs.CV

AI总结 本文提出了一种动作-区域跟踪框架,通过查询-响应机制捕捉细粒度动作细节,提升视频动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏