arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7464 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7464 篇

2311.17842 2023-12-27 cs.RO cs.AI cs.CL cs.CV cs.LG 75%

Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning

Yingdong Hu, Fanqi Lin, Tong Zhang, Li Yi, Yang Gao

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments arXiv v2: add appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12856 2023-12-21 cs.CV cs.AI cs.LG 75%

SkyScript: A Large and Semantically Diverse Vision-Language Dataset for Remote Sensing

Zhecheng Wang, Rajanie Prabha, Tianyuan Huang, Jiajun Wu, Ram Rajagopal

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12981 2023-07-25 cs.CV cs.AI cs.CL cs.LG cs.RO 75%

3D-LLM: Injecting the 3D World into Large Language Models

Yining Hong, Haoyu Zhen, Peihao Chen, Shuhong Zheng, Yilun Du, Zhenfang Chen, Chuang Gan

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project Page: : https://vis-www.cs.umass.edu/3dllm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.01169 2022-01-20 cs.CV cs.AI cs.LG 75%

Transformers in Vision: A Survey

Salman Khan, Muzammal Naseer, Munawar Hayat, Syed Waqas Zamir, Fahad Shahbaz Khan, Mubarak Shah

专题命中 视觉定位与Grounding :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 30 pages (Accepted in ACM Computing Surveys December 2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19209 2026-03-20 cs.CV cs.LG 74%

Do VLMs Need Vision Transformers? Evaluating State Space Models as Vision Encoders

视觉语言模型需要视觉变换器吗?评估状态空间模型作为视觉编码器

Shang-Jui Ray Kuo, Paola Cascante-Bonilla

机构 * Stony Brook University(石英 Brook 大学)

专题命中 视觉定位与Grounding :VLM(abstract,comments);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文评估了状态空间模型作为视觉编码器在视觉语言模型中的有效性,发现其在VQA和定位任务中表现优异,并提出稳定策略提升鲁棒性。

Comments Project page: https://lab-spell.github.io/vlm-ssm-vision-encoders/ ; Code: https://github.com/raykuo18/vlm-ssm-vision-encoders

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20844 2026-08-24 cs.AI 新提交 74%

TRACE: Agentic Catalog Enrichment with Multi-source Evidence Grounding

TRACE:基于多源证据锚定的智能体式商品目录丰富

Rohan Kumar, Steven Xu, Kyle MacDonald, Matthew Long, Bernice Chow, Mac VanRenterghem, Sudeep Das

机构 * DoorDash(多闸道科技(DoorDash))

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 针对电商商品目录属性稀疏问题,提出基于LLM的TRACE框架,经离线评估、生产部署及在线实验验证,可高效提升目录属性丰富的准确率、覆盖率及结账转化率。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19974 2026-08-21 cs.AI 新提交 74%

ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance

ReguSim:评估大语言模型智能体在金融合规中的规则落地

Yiyang Luo, Yihang Jiang, Qijun Xie, Liang Lan, Lin Willian Cong, Anyi Rao, Yunya Song

机构 * HKUST(香港科技大学) HKBU(香港浸会大学) NTU(新加坡南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11928 2026-08-13 cs.CV 新提交 74%

Seed2GS: Camera-Free, Training-Free Object Extraction from 3D Gaussian Scenes via a Single Reference-View Grounding

Seed2GS:通过单个参考视图定位从3D高斯溅射(3DGS)场景中进行无相机、无训练的目标提取

Zongjian Ding, Yudong Gao, Jiale Liu, Xinglin Yu, Junxing Ren, Dong Wei, Yajing Chen, Shan Huang, Mingjun Cheng, Min Li

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV

AI总结 Seed2GS是一种无相机、无训练的目标提取方法,通过分离目标身份与3D覆盖范围,在LERF-MASK和3D-OVS数据集上实现了高精度,且计算延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05876 2026-08-07 cs.AI cs.CL 新提交 74%

Personalized Deep Research Query Refinement with Graph-Scaffolded Evidence Grounding

基于图支架证据锚定的个性化深度研究查询优化

Soojin Yoon, Dongha Lee

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 本研究提出G-STEER方法,通过图支架证据锚定优化用户请求为个性化研究规范,在提升深度研究智能体报告个性化的同时,大幅减少向用户提问的数量。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05138 2026-08-06 eess.AS cs.AI cs.CL 新提交 74%

Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains

让Nemotron学习希腊语:针对专业领域现代希腊语的语料库挖掘、检索适配与生成落地

Ayoub Kirouane, Christos Petrocheilos

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 本研究针对现代希腊语缺失于Nemotron检索模型及主流多语言基准的问题,提出Nemotron检索栈的端到端适配方案,含语料库挖掘等步骤,推出首个希腊语RAG基准HERA,适配后的模型在多项指标上显著提升。

Comments 15 pages, 10 figures, 7 tables. Includes release of the HERA benchmark and Sophea Nemo RAG models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00883 2026-08-05 cs.MM cs.CV cs.SD 版本更新 74%

Audio-Visual World Models: Learning Physically Grounded Multisensory Dynamics

视听世界模型:为具身智能体奠定多感官想象的基础

Jiahua Wang, Leqi Zheng, Jialong Wu, Yaoxin Mao, Shijie Cheng

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV

AI总结 提出视听世界模型(AVWM)统一框架,通过条件扩散Transformer(AV-CDiT)联合预测双耳音频与视觉动态,在30小时基准AVW-4k上实现高保真多模态预测,并验证其在具身导航中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00452 2026-08-04 cs.IR cs.AI 新提交 74%

CeQe: Grounding Lexical Retrieval in Semantic Evidence

CeQe:在语义证据中实现词汇检索

Adam Kahirov, Umesh Deshpande, Swaminathan Sundararaman

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 针对BM25的语义词汇鸿沟问题,本文提出CE-QE方法,利用交叉编码器的语义检索结果扩展BM25查询,在多个BEIR数据集上显著提升检索性能且不修改底层索引。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31045 2026-08-03 cs.AI 版本更新 74%

LabGuard: Grounding Natural-Language Laboratory Rules into Runtime Guards for Embodied Laboratory Agents

LabGuard:将自然语言实验室规则转化为具身实验室代理的运行时守卫

Jingpu Yang, Fengxian Ji, Zhengzhao Lai, Zhexuan Cui, Guangxian Ouyang, Qian Jiang, Fan Zhang, Min Peng, Qianqian Xie, Preslav Nakov, Zhuohan Xie

机构 * Wuhan University(武汉大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Northeastern University(东北大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 提出LabGuard,一种将自然语言实验室规则转化为可执行规范并部署为运行时守卫的安全套件,通过三个核心组件实现规则到监控的映射,实验表明能有效降低不安全事件。

Comments First three authors are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25748 2026-07-29 cs.AI 新提交 74%

Loss Invariance Determines What Concept Layers Encode: Volume Grounding in Echocardiography

损失不变性决定概念层编码的内容:超声心动图中的容积定位

Hyunkyung Han, Min Jung Kim

机构 * Yonsei University College of Medicine(延世大学医学院) Research Institute of Radiologic Science(放射科学研究所)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 研究以超声心动图视频中左心室容积为概念探讨概念瓶颈模型有效性,通过训练视频变压器编码器,比较不同训练方式,发现仅概念准确性不足,可解释中间变量应依训练目标不变性结构验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21496 2026-07-24 eess.SP cs.LG 新提交 74%

Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models

使用基于语音的多模态大语言模型实现可泛化的认知障碍检测

Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao

机构 * Faculty of Digital Innovation, Arts \& Sciences, Saskatchewan Polytechnic, Regina SK S4S 5X1, Canada School of Basic Medical Sciences, Hebei University, Baoding 071000, China Department of Civil \& Environmental Engineering School of Mining \& Petroleum Engineering, University of Alberta, Edmonton AB T6G 2H5, Canada

专题命中 视觉定位与Grounding :multimodal large language model(title);分类 cs.LG

AI总结 研究针对认知障碍检测问题,提出基于开源大语言模型的多模态检测框架,整合语音音频与转录文本,提取特定模态嵌入后连接成特征向量用于分类,在相关基准数据集上评估,该框架准确率达92.4%,优于单模态基线且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04539 2026-07-20 cs.CL cs.AI 版本更新 74%

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization

RLearner-LLM: 通过混合直接偏好优化平衡大语言模型中的逻辑性与流畅性

Qiming Bao, Juho Leinonen, Paul Denny, Michael J. Witbrock

机构 * University of Auckland(奥克兰大学) Aalto University(阿alto大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 本文提出RLearner-LLM,通过融合DeBERTa-v3 NLI信号与验证器LLM评分,解决直接偏好优化在知识密集型生成中的逻辑对齐问题,实现NLI指标显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10598 2026-07-14 cs.CV 新提交 74%

Anomalous Frame Detection by Grouping Frame Similarities between Two Videos Computed by Vision-Language Model to Extract Expert Workers' Unique Actions

通过对视觉语言模型计算的两个视频之间的帧相似性进行分组来检测异常帧,以提取专家工人的独特动作

Ryo Sakai, Yongpeng Cao, Nobutaka Kimura

专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV

AI总结 针对熟练维护工人减少的问题,提出通过比较两个视频帧相似性检测异常帧来提取专家独特动作的方法,在模拟实验中对特定动作类型提取率达66.9%,比传统技术提高50个百分点,有助于技能转移和劳动力发展。

Comments 11 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09008 2026-07-13 cs.CV 新提交 74%

C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes

C-GAP:类感知与在线提示改进不均衡类上的视觉语言模型

Francis Fernandez, Arash Jahangiri, Salimeh Sekeh

机构 * San Diego State University(圣地亚哥州立大学)

专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV

AI总结 研究针对安全关键感知系统检测小标签空间中罕见物体类别的问题,提出C-GAP框架,通过建立复合字幕基线并利用语言模型迭代细化提示,无需更新检测器权重,有效提升少数类检测精度,实验证明其成效显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12138 2026-07-10 cs.AI cs.CL cs.IR 版本更新 74%

Retrieval-Augmented Generation Must Move Beyond Factual Grounding to Represent Diverse Opinions

检索增强生成必须超越事实基础以代表多样化观点

Aditya Agrawal, Alwarappan Nakkiran, Darshan Fofadiya, Alex Karlsson, Harsha Aduri, Aman Singh Thakur

机构 * Amazon.com(亚马逊公司)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 本文指出检索增强生成系统存在系统性事实偏差,并提出需要在检索系统设计上进行范式转变,通过不确定性量化方法提出统一目标,并展示Opinion-Aware RAG架构在两个领域中的实验结果,证明其在多样性、公平性和准确性方面的提升。

Comments 18 pages, Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07866 2026-07-07 cs.RO cs.LG cs.SY eess.SY 版本更新 74%

Language-Guided Grasping under Partial Observation for Mobile Manipulation in Field Inspection and Maintenance

用于现场检查和维护中移动操作的部分观察下语言引导抓取

Dilermando Almeida, Juliano Negri, Guilherme Lazzarini, Thiago H. Segreto, Ranulfo Bezerra, Gustavo J. G. Lahr, Ricardo V. Godoy, Marcelo Becker

机构 * Department of Mechanical Engineering, Federal University of Uberlândia(联邦大学伯南迪利亚机械工程系) Department of Mechanical Engineering, University of São Paulo(圣保罗大学机械工程系) Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) Faculdade Israelita de Ensino e Pesquisa Albert Einstein, Hospital Israelita Albert Einstein(艾伯特·爱因斯坦以色列教学与研究学院,艾伯特·爱因斯坦医院)

专题命中 视觉定位与Grounding :VLM(title);分类 cs.LG

AI总结 提出用于腿部移动操纵器在部分观察下的语言引导抓取流程,经多步骤处理,在四足机器人上实现并评估,相比基线提高抓取成功率,提升语言引导抓取可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28696 2026-06-30 cs.AI 74%

COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models

COMPASS:在统一多模态模型中锚定构图意图引导

Ziqi Zhou, Weize Quan, Mining Tan, Zhihan Chen, Dandan Zheng, Jingdong Chen, Jun Zhou, Weiming Dong, Dong-Ming Yan

机构 * University of Edinburgh(爱丁堡大学) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Ant Group(蚂蚁集团)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 提出统一框架COMPASS,通过共享专家令牌τ_c实现构图感知与生成的双向锚定,结合MoE骨干和Comp-11数据集,显著提升细粒度构图理解与可控生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20562 2026-06-29 cs.CV 版本更新 74%

PhysChoreo: Physics-Controllable Video Generation with Part-Aware Semantic Grounding

PhysChoreo: 具有部分感知语义基础的物理可控视频生成

Haoze Zhang, Tianyu Huang, Zichen Wan, Xiaowei Jin, Hongzhi Zhang, Hui Li, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV

AI总结 提出PhysChoreo框架,通过两阶段方法(部分感知物理属性重建与时序指导的可编辑物理模拟)从单张图像生成物理可控且逼真的视频,在多个指标上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24344 2026-06-24 cs.LO cs.AI 新提交 74%

What Does ODRL Mean? A Cross-Level Ontological Grounding of Permissions, Prohibitions, and Duties in UFO-L

ODRL 意味着什么?UFO-L 中许可、禁止和义务的跨层次本体论基础

Daham M. Mustafa, Christoph Lange, Giancarlo Guizzardi, Diego Collarana, Christoph Quix, Stefan Decker

机构 * University of Twente, The Netherlands(特文特大学,荷兰) RWTH Aachen University, Aachen, Germany(亚琛工业大学,德国)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 针对 ODRL 策略评估器忽略规范立场、权威结构等问题,提出跨层次设计原则,将 ODRL 规则映射到 UFO-L 中的法律关联子,从两种扩展至八种法律立场,并在 Isabelle/HOL 中机械验证。

Comments Accepted at FOIS 2026 (16th International Conference on Formal Ontology in Information Systems), Vitória, Brazil; to appear in Frontiers in Artificial Intelligence and Applications, IOS Press. 16 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18264 2026-06-18 cs.SI cs.AI cs.CL 新提交 74%

Simulating Hate Speech Cascades with Multi-LLM Agents: Empirical Grounding, Modeling Fidelity, and Intervention Strategies

使用多LLM智能体模拟仇恨言论级联:实证基础、建模保真度与干预策略

Fan Huang

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 本研究通过多LLM智能体系统模拟在线仇恨言论传播,发现其能再现实证数据中的立场单一性和毒性同质性,并通过消融实验识别出智能体异质性为关键保真因素,提出针对密集网络的放大器干预策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16137 2026-06-16 cs.CL cs.AI 新提交 74%

XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models

基于XAI的语音深度伪造检测解释生成:使用免训练多模态大语言模型

Yupei Li, Qiyang Sun, Xiaoliang Wu, Chenxi Wang, Berrak Sisman, Björn W. Schuller

机构 * Imperial College London(帝国理工学院) Technical University of Munich(慕尼黑工业大学) University of Southampton(南安普顿大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉定位与Grounding :multimodal large language model(title);分类 cs.AI

AI总结 针对语音深度伪造检测缺乏可解释性的问题,提出一种免训练框架,融合XAI证据与多模态大语言模型,生成基于证据的特定解释,在PartialSpoof数据集上内部准确率提升超45%。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12985 2026-06-12 cs.CV 新提交 74%

Objects Before Words: Object-First Inductive Biases for Grounding Language in Child-View Video

物体先于词汇:用于从儿童视角视频中语言接地学习的物体优先归纳偏置

Sathira Silva, Abrham Kahsay Gebreselasie, Muhammad Umer Sheikh, Kartik Kuckreja, Daniel Harari, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV

AI总结 针对婴儿视角视频中命名参照物出现时间和位置的双重歧义,提出BabyMind方法,通过物体优先的归纳偏置、掩码区域接口和原型空间多实例对比学习,在稀疏弱监督下提升语言接地性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03080 2026-06-03 cs.CL cs.AI 74%

Regret Pre-training: Bridging Prior and Posterior Views for Enhanced Knowledge Grounding

遗憾预训练:桥接先验与后验视角以增强知识基础

Mingkuan Zhao, Xiayu Sun, Wentao Hu, Suquan Chen, Jiaxuan Li, Xiaoyan Zhu, Xin Lai, Jiayin Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 提出遗憾预训练框架,通过双视角架构利用未来信息增强因果语言模型,在OLMoE-1B-7B架构上平均准确率提升至33.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20142 2026-06-03 cs.LG 74%

Grounding Functional Similarity by Invariance-Aware Model Stitching

通过不变性感知模型拼接实现功能相似性评估

Ioannis Athanasiadis, Anmar Karmush, Michael Felsberg

机构 * Ioannis Athanasiadis Anmar Karmush Michael Felsberg

专题命中 视觉定位与Grounding :grounding(title);分类 cs.LG

AI总结 针对标准模型拼接忽略不变性导致功能相似性误判的问题,提出前向-后向兼容性要求下的不变性感知模型拼接方法,揭示隐藏的功能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22963 2026-05-25 cs.CL cs.AI 74%

Graph Alignment Topology as an Inductive Bias for Grounding Detection

图对齐拓扑作为接地检测的归纳偏置

Paul Landes, Pranav Herur, Adam Cross, Jimeng Sun

机构 * Department of Pediatrics, University of Illinois College of Medicine Peoria(伊利诺伊大学皮奥里亚医学院儿科部) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机与数据科学学院) Carle Illinois College of Medicine, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校卡莱医学院)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 提出利用图对齐拓扑作为归纳偏置,通过构建参考信息与LLM输出之间的对齐二分图并训练图神经网络建模对齐结构,在幻觉检测和问答任务上取得最先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22217 2026-05-22 cs.LG cs.CL 74%

Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL

生存或崩溃:自我博弈强化学习中数据门控与奖励基础的不对称作用

Sophia Xiao Pu, Zhaotian Weng, Chengzhi Liu, Jayanth Srinivasa, Gaowen Liu, William Yang Wang, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) Cisco Research(思科研究)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.LG

AI总结 本文研究了自我博弈强化学习中数据门控和奖励基础的不对称作用,发现数据门控是维持稳定的关键因素,而奖励信号在门控移除后无法单独保证稳定性,揭示了'基础提出者悖论'。

详情

展开后加载摘要…

URL PDF HTML 收藏