arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7583 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7583 篇

2506.08774 2026-06-30 cs.IR cs.AI 57%

Multimodal Representation Alignment for Cross-modal Information Retrieval

多模态表示对齐用于跨模态信息检索

Fan Xu, Luis A. Leiva

机构 * University of Luxembourg(卢森堡大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文研究多模态表示对齐对跨模态检索的影响,通过对比不同度量标准和嵌入空间,发现余弦相似度在对齐任务中表现最佳,同时 Wasserstein 距离提供了分布差异的补充视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27440 2026-06-29 cs.LG 新提交 57%

PairSAE: Mechanistic Interpretability from Pair Representations in Protein Co-Folding

PairSAE: 蛋白质共折叠中成对表示的机制可解释性

Giosue Migliorini, Aristofanis Rontogiannis, Grigori Guitchounts, Nicholas Franklin, Axel Elaldi, Olivia Viessmann

机构 * University of California, Irvine(加州大学尔湾分校) Flagship Pioneering

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 针对蛋白质共折叠模型中的成对表示,提出PairSAE方法,通过N-mode SVD总结成对张量为token级交互角色,再用稀疏自编码器学习共享特征,实现可解释性并避免传统SAE的二次爆炸问题。

Comments Accepted at the Machine Learning in Structural Biology (MLSB) 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18714 2026-06-26 cs.CV cs.AI 版本更新 57%

Semantic Generative Tuning for Unified Multimodal Models

语义生成微调用于统一多模态模型

Songsong Yu, Yuxin Chen, Ying Shan, Yanwei Li

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent ARCLab(腾讯ARCLab)

专题命中 知识编辑与模型理解 :post-training(abstract);分类 cs.AI

AI总结 本文提出语义生成微调(SGT)方法,通过将高阶语义任务作为生成代理,统一多模态模型的感知与生成能力,提升多模态理解和生成质量。

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24997 2026-06-25 cs.LG 新提交 57%

What's in an Earth Embedding? An Explainability Analysis of Location Encoders

地球嵌入中有什么?位置编码器的可解释性分析

Livia Betti, Sebastian Ricke, Ivica Obadic, Adam J. Stewart, Esther Rolf

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 通过稀疏自编码器、自然语言概念和视觉特征分解地理隐式神经表示的位置嵌入,揭示其编码的可解释地理结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24716 2026-06-24 cs.CV cs.AI 新提交 57%

Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations

评估稀疏自编码器与概念标注的可解释性

Jonas Klotz, Cassio F. Dantas, Pallavi Jain, Diego Marcos, Begüm Demir

机构 * The Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所) Technische Universität Berlin(柏林工业大学) INRAE(法国国家农业、食品与环境研究院) Inria, EVERGREEN(法国国家信息与自动化研究所,EVERGREEN) UMR TETIS, Univ Montpellier(UMR TETIS,蒙彼利埃大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 提出一种基于人类标注的评估框架,通过合成基准和二分匹配方法量化稀疏自编码器潜在变量与概念的对齐,并验证可解释性。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21179 2026-06-23 cs.LG 新提交 57%

Rejections Based on Predictive Uncertainty Enable Reliable Routine Soil Spectroscopy

基于预测不确定性的拒绝机制实现可靠的常规土壤光谱学

Jonas Schmidinger, Robin Gebbers, Marc-Olivier Gasser, Viacheslav Barkov, G. Mick Wu, Viacheslav I. Adamchuk

机构 * Joint Lab Artificial Intelligence and Data Science, Osnabrück University(奥斯纳布吕克大学人工智能与数据科学联合实验室) Department of Agromechatronics, Leibniz Institute for Agricultural Engineering and Bioeconomy (ATB)(莱布尼茨农业工程与生物经济研究所农业机电一体化系) Research and Development Institute for the Agri-environment (IRDA)(农业环境研究与发展研究所) Department of Bioresource Engineering, McGill University(麦吉尔大学生物资源工程系)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 提出“拒绝-重测”框架,结合概率建模与不确定性引导的拒绝,在保证准确性的同时降低土壤光谱测量成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20705 2026-06-23 cs.CV cs.AI cs.RO 新提交 57%

MotionPyramid: Hierarchical Motion Representation and Residual Interfaces

MotionPyramid: 分层运动表示与残差接口

Gao Zhu, Zaishuo Xia, Yubei Chen

机构 * UC Davis(加州大学戴维斯分校)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.AI

AI总结 提出MotionPyramid,一种从运动数据中学习层次化动作表示的方法,通过冻结预训练层次为下游强化学习提供多分辨率控制接口,并引入残差接口实现粗细粒度协同控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21911 2026-06-23 cs.CV cs.LG eess.IV 版本更新 57%

A Latent Representation Learning Framework for Hyperspectral Image Emulation in Remote Sensing

遥感高光谱图像模拟的潜在表示学习框架

Chedly Ben Azizi, Claire Guilloteau, Gilles Roussel, Matthieu Puigt

机构 * univ-littoral(里弗拉尔大学)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 提出基于潜在表示的高光谱模拟框架,支持光谱级和空间-光谱级模拟,通过变分自编码器与参数映射两步策略,在PROSAIL模拟数据和Sentinel-3 OLCI图像上优于传统回归方法,并保持下游参数反演性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03531 2026-06-23 cs.LG cs.CV 版本更新 57%

Robust Representation Learning in Masked Autoencoders

掩码自编码器中的鲁棒表示学习

Anika Shrivastava, Renu Rameshan, Samar Agnihotri

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 本文通过分析掩码自编码器(MAE)的表示学习机制,发现其预训练和微调后的表示对模糊、遮挡等退化具有鲁棒性,并通过层间分析和敏感性指标揭示了其类感知子空间和全局注意力机制。

Comments To appear in ICPR 2026. 10 pages, 5 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03448 2026-06-23 cs.CV cs.AI 版本更新 57%

Hierarchical Concept-to-Appearance Guidance for Multi-Subject Image Generation

多主体图像生成的层次化概念到外观引导

Yijia Xu, Zihao Wang, Haokun Gui, Jinshi Cui

机构 * Peking University(北京大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 提出层次化概念到外观引导框架(CAG),通过VAE dropout训练和对应感知掩码注意力模块,实现多主体图像生成中身份一致性和精确组合控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20559 2026-06-19 cs.CV cs.LG 新提交 57%

UNIEGO: Proxies as Mediators for Unified Egocentric Video Representation Learning

UNIEGO:代理作为中介的统一自我中心视频表示学习

Wenhao Chi, Arkaprava Sinha, Dominick Reilly, Hieu Le, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 提出分层多教师蒸馏框架UNIEGO,通过代理模型将异构教师知识转化为同质自我中心空间,并采用选择性代理蒸馏自适应筛选可靠监督,在三个自我中心视频理解任务上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02636 2026-06-19 q-bio.NC cs.AI 版本更新 57%

A Deep Generative Model for Resting-State EEG Synthesis and Transferable Representation Learning

一种用于静息态脑电合成与可迁移表示学习的深度生成模型

Yeganeh Farahzadi, Morteza Ansarinia, Zoltan Kekecs

机构 * Institute of Psychology, Eötvös Loránd University(埃斯特哈兹·洛朗大学心理学研究所) Doctoral School of Psychology, Eötvös Loránd University(埃斯特哈兹·洛朗大学心理学博士学院) Department of Behavioural and Cognitive Sciences, University of Luxembourg(卢森堡大学行为与认知科学系)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 提出REST-GAN框架,结合对抗训练与自监督重构,从原始时域信号合成静息态EEG并学习可迁移表示,在频谱、连接性及分类任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18043 2026-06-17 cs.RO cs.LG 新提交 57%

Uncertainty Quantification for Flow-Based Vision-Language-Action Models

基于流的视觉-语言-动作模型的不确定性量化

Ralf Römer, Maximilian Seeliger, Saida Liu, Ben Sturgis, Marco Bagatella, Daniel Marta, Andreas Krause, Angela P. Schoellig

机构 * TU Munich(慕尼黑工业大学) ETH Zurich(苏黎世联邦理工学院) MPI IS Tübingen(马克斯·普朗克智能系统研究所)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 提出利用速度场差异(VFD)量化流匹配模型中的认知不确定性,用于故障检测和主动微调,在LIBERO基准上实现高效任务适应。

Comments Project page: tum-lsy.github.io/uq_vla/. 28 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04198 2026-06-17 stat.ML cs.LG 版本更新 57%

Stable and Steerable Sparse Autoencoders with Weight Regularization

基于权重正则化的稳定且可操控的稀疏自编码器

Piotr Jedryszek, Oliver M. Crook

机构 * Department of Biology, University of Oxford, Oxford, UK(牛津大学生物学系) Kavli Institute for Nanoscience Discovery, University of Oxford, Oxford, UK(牛津大学纳科学发现研究所) Department of Chemistry, University of Oxford, Oxford, UK(牛津大学化学系)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 通过L1/L2权重正则化提高稀疏自编码器的跨种子特征一致性,并在语言模型上提升操控成功率,同时保持可解释性分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15503 2026-06-16 cs.AI cs.CY cs.MA cs.NE 新提交 57%

Synthetic Counteradaptation: A Principle of Human-AI Co-evolution

合成反适应:人机共同进化的一个原理

Ivar Frisch, Jackie Kay, Philip Moreira Tomei

机构 * Spectral Circuits Research Independent Researcher(独立研究者) AI Objectives Institute(AI Objectives研究所)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.AI

AI总结 提出合成反适应概念,描述人机通过相互适应策略和行为实现共同进化,并分析围棋、混合动机社交和地缘政治模拟等案例。

Comments 15 pages, 1 figure. Published in Antikythera (MIT Press), February 2025

Journal ref Antikythera Journal, MIT Press, February 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15038 2026-06-16 cs.AI 新提交 57%

Fusion is not one-size-fits-all: Cross-Modal Representation Alignment for Time-to-Event Modeling

融合并非一刀切:用于时间-事件建模的跨模态表示对齐

Zhemin Zhang, Weijie Chen, David Le, Amara Tariq, Alex Wallace, Matthew Stib, Juan Maria Farina, Chadi Ayoub, Reza Arsanjani, Imon Banerjee

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 针对多模态临床数据中的模态不平衡和分布偏移问题,提出一种基于基础模型的跨模态对齐框架,通过四种融合策略在CT影像和纵向EHR数据间进行表示对齐,在肺栓塞死亡率和心血管疾病结局预测任务上验证了融合的有效性,并首次系统分析了时间-事件预测中的模态不平衡对融合行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14758 2026-06-16 cs.CV cs.AI 新提交 57%

Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability

解构幻觉:正交语义投影实现鲁棒可解释性

Emirhan Bilgiç, Baptiste Caramiaux, Zhi Yan, Gianni Franchi

机构 * U2IS, ENSTA, Institut Polytechnique de Paris(巴黎综合理工学院ENSTA学院U2IS实验室) ISIR, Université Sorbonne, Pierre et Marie Curie(索邦大学皮埃尔和玛丽·居里分校ISIR实验室) AMIAD, Pôle Recherche(AMIAD研究部)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 针对视觉语言模型解释中的语义幻觉问题,提出线性语义归因(LSA)理论框架,并引入正交语义投影(OSP)方法,通过正交化查询向量消除共享特征干扰,最小化幻觉。

Comments 41 pages in total. 5 figures, and 2 tables in the main paper; 10 figures and 17 tables in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18909 2026-06-16 cs.LG cs.SY eess.SY 版本更新 57%

Descriptive versus Regulatory Uncertainty in Bounded Predictive Systems

描述性不确定性与监管性不确定性在有界预测系统中的区别

Ahmed Gamal Eldin

机构 * Nova University Lisbon – Cairo Branch (NOVA IMS)(里斯本诺瓦大学-开罗分校区(NOVA IMS))

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 本文研究了有界预测系统中描述性不确定性与监管性不确定性的区别,证明了当前Transformer架构在推理时仅限于描述性不确定性,并通过热力学原理和实验验证了这种区别,发现熵与准确性相互正交,且系统规模不影响熵的平坦性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24058 2026-06-16 cs.CV cs.AI 版本更新 57%

Mitigating Object Hallucinations in LVLMs via Attention Imbalance Rectification

通过注意力不平衡修正减轻LVLM中的对象幻觉

Han Sun, Qin Li, Peixin Wang, Min Zhang

机构 * Shanghai Key Laboratory of Trustworthy Computing, East China Normal University(上海可信计算实验室,东华大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 发现多模态和token间注意力不平衡是对象幻觉的因果因素,提出轻量级解码干预方法AIR,通过重新分配注意力权重修正不平衡,在多个基准上减少幻觉达35.1%,并提升通用能力。

Comments CVPR 2026 Findings Track, code is available at https://github.com/Ice-wave/AIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16077 2026-06-15 cs.LG 版本更新 57%

Ensembling Sparse Autoencoders

集成稀疏自编码器

Soham Gadgil, Chris Lin, Su-In Lee

机构 * Paul G. Allen School of Computer Science \& Engineering, University of Washington

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 针对单个稀疏自编码器只能捕获激活空间中有限特征的问题,提出通过朴素Bagging和Boosting集成多个SAE,理论证明可降低重构误差,实验表明集成方法在重构质量、稳定性和下游任务上优于扩展单个SAE。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20076 2026-06-12 cs.LG 版本更新 57%

ExPLAIND: Unifying Model, Data, and Training Attribution to Study Model Behavior

ExPLAIND:统一模型、数据和训练归因以研究模型行为

Florian Eichin, Yupei Du, Philipp Mondorf, Maria Matveev, Barbara Plank, Michael A. Hedderich

机构 * University of Michigan(密歇根大学)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 提出ExPLAIND框架,统一归因于模型组件、数据和训练轨迹,支持跨粒度解释,通过梯度路径核和AdamW核机器推导参数级和步骤级影响分数,验证了Transformer的Grokking和EuroLLM预训练中的两阶段动态。

Comments published at ICML 2026, code at https://github.com/mainlp/explaind

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22050 2026-06-12 cs.LG 版本更新 57%

BrainPro: Towards Large-scale Brain State-aware EEG Representation Learning

BrainPro:迈向大规模脑状态感知的脑电图表征学习

Yi Ding, Muyun Jiang, Weibang Jiang, Shuailei Zhang, Xinliang Zhou, Chenyu Liu, Shanglin Li, Yong Li, Cuntai Guan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Advanced Telecommunications Research Institute International(先进电信研究院) Southeast University(东南大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 提出BrainPro模型,通过检索式空间对齐和脑状态解耦模块,学习共享与特定状态表征,在9个公共BCI数据集上取得最优性能。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12088 2026-06-11 cs.CL 新提交 57%

Debiasing Without Protected Attributes: Latent Concept Erasure from Textual Profiles

无保护属性的去偏:从文本画像中消除潜在概念

Shun Shao, Zheng Zhao, Anna Korhonen, Yftah Ziser, Shay B. Cohen

机构 * University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学) University of Groningen(格罗宁根大学) NVIDIA Research(英伟达研究院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 提出H-SAL方法,利用自我描述文本作为隐式信号进行后处理概念和属性消除,在无直接敏感属性下实现去偏,并在多领域Stack Exchange基准上验证其效果与显式标签去偏相当或更优。

Comments 23 pages, 5 figures, 12 tables. The paper is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22397 2026-06-11 cs.NI cs.LG 版本更新 57%

NetBurst: Event-Centric Forecasting of Bursty, Intermittent Time Series

NetBurst: 以事件为中心的突发间歇性时间序列预测

Satyandra Guthula, Jaber Daneshamooz, Charles Fleming, Kesheng Wu, Walter Willinger, Arpit Gupta

机构 * University of California, Santa Barbara(加州大学圣巴bara分校) Cisco Research(思科研究) Lawrence Berkeley National Laboratory(伯克利国家实验室) Northwestern University(西北大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 针对网络遥测数据中罕见突发和长间隔低活动的“野性”统计特性,提出NetBurst事件中心管道,通过压缩低活动期、分离突发时序和幅度流学习统一表示,在预测误差、突发分布匹配和异常描述性上显著优于Chronos-2等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10614 2026-06-10 cs.RO cs.CV cs.LG 新提交 57%

Dexterous Point Policy: Learning Point-based Dexterous Hand Policies from Human Demonstrations

灵巧点策略:从人类演示中学习基于点的灵巧手策略

Beomjun Kim, Seong Hyeon Park, Seunghoon Sim, Seungjun Moon, Sanghyeok Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 提出Dexterous Point Policy框架,通过统一3D关键点表示从人类视频学习灵巧操作策略,无需机器人演示,在真实任务中达到75%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06735 2026-06-10 cs.AI 版本更新 57%

A Geometric Account of Activation Steering through Angle-Norm Decomposition

通过角度-范数分解的激活引导的几何解释

Georgii Aparin, Tatiana Gaintseva

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Queen Mary University of London(女王玛丽大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文通过控制实验分离角度和径向分量,发现概念主要编码在角度结构中,但范数对引导的稳定性和下游效应至关重要,建议将激活引导参数化为可解释的角度和径向分量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09148 2026-06-09 cs.CL 新提交 57%

Explicit Representation Alignment for Multimodal Sentiment Analysis

显式表示对齐用于多模态情感分析

Baode Wang, Ziming Wang, Huacan Wang, Ronghao Chen, Biao Wu

机构 * AgentAlpha

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 针对多模态情感分析中表示不对齐问题,提出利用视觉-语言模型将视觉内容转为文本描述,结合语义标记选择和批量级均匀性正则化,实现跨模态对齐,在多个基准上取得最优性能。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22697 2026-06-09 q-bio.NC cs.AI cs.CV 版本更新 57%

Brain2Text Decoding Model Reveals the Neural Mechanisms of Visual Semantic Processing

Brain2Text解码模型揭示视觉语义处理的神经机制

Feihan Feng, Jingxin Nie

机构 * Ministry of Education Center for Studies of Psychological Application(教育部心理应用研究中心) Center for Studies of Psychological Application(心理应用研究中心) Key Laboratory of Brain, Cognition and Education Sciences(脑认知与教育科学重点实验室) School of Psychology(心理学学院) Guangdong Key Laboratory of Mental Health and Cognitive Science(广东省心理健康与认知科学重点实验室)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 提出一种直接从fMRI信号解码自然图像语义描述的深度学习模型,揭示了高级视觉皮层在语义处理中的关键作用,并展示了类别特异性神经表征。

Comments 39 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05109 2026-06-04 cs.LG 57%

RePercENT: Scaling Disentangled Representation Learning Beyond Two Modalities

RePercENT:将解耦表示学习扩展到两种模态之外

Vasiliki Rizou, Pascal Frossard, Dorina Thanou

机构 * EPFL(瑞士联邦理工学院)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 提出RePercENT框架,通过多模态即插即用架构和联合优化目标,实现超过两种模态的可扩展成对解耦,无需联合预训练并降低计算复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04391 2026-06-04 cs.AI 57%

Online Skill Learning for Web Agents via State-Grounded Dynamic Retrieval

基于状态接地动态检索的Web代理在线技能学习

Jiaxi Li, Ke Deng, Yun Wang, Jingyuan Huang, Yucheng Shi, Qiaoyu Tan, Jin Lu, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Tencent America(腾讯美国) New York University(纽约大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 知识编辑与模型理解 :language agent(abstract);分类 cs.AI

AI总结 提出状态接地动态检索(SGDR)方法,通过逐步技能重用提升Web代理在多步自动化任务中的表现,在WebArena上平均成功率分别达到37.5%(GPT-4.1)和24.3%(Qwen3-4B)。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏