arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Washington(华盛顿大学)

共收录 1157
2608.18050 2026-08-19 cs.AI 新提交

StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents

StagedWorkspace:面向知识工作智能体的版本化工作空间

Yining Hua, Hongbin Na, Yifan Zhou, Akshay Kalose, Cyrus Ayubcha, Levi Lian

机构 * Harvard University(哈佛大学) Raycaster AI(雷caster人工智能公司) University of Technology Sydney(悉尼科技大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 该研究针对知识工作智能体的版本化工作空间问题,提出StagedWorkspace方案,通过绑定解析记录与原生文件内容哈希提升性能,在OfficeQA Pro等数据集上取得显著优于基准的效果,为相关基准构建提供了新方向。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18009 2026-08-19 cs.CV 新提交

Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering

基于记忆树引导的关键帧查询的高效三维问答

Hsiang-Wei Huang, Fu-Chen Chen, Li-Wu Tsao, Cheng-Han Lee, Che-Chun Su, Lu Xia, Ronghui Peng, Jenq-Neng Hwang, Min Sun, Cheng-Hao Kuo

机构 * University of Washington(华盛顿大学) Amazon(亚马逊公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究针对具身场景三维问答的效率问题,提出MemTree3D记忆树引导的关键帧选择方法,在OpenEQA数据集上显著提升GPT-4o与LLaVA-OneVision-7B的问答性能,优于现有视觉搜索方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17561 2026-08-19 cs.CV cs.LG 新提交

Leveraging existing sparse point annotations for benthic imagery dense segmentation

利用现有稀疏点标注进行底栖图像的密集分割

Cesar Borja, Breck A. McCollum, Jarret E. Byrnes, Kenneth Sebens, Ana C. Murillo

机构 * Universidad de Zaragoza(萨拉戈萨大学) Berklee College of Music(伯克利音乐学院) University of Washington(华盛顿大学)

AI总结 本研究结合SAM2基础模型与底栖图像的稀疏专家点标注,提出自动筛选可靠点的机制以生成高质量伪真值掩码,训练细粒度分割模型,还引入新基准推进生态分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17027 2026-08-19 cs.RO 新提交

FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences

FetchMan:基于模拟经验学习人形机器人视觉 locomotion-manipulation(移动操作)策略

Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

AI总结 该研究提出 FetchMan,通过端到端 sim-to-real 流水线训练人形机器人视觉移动操作策略,在 FetchMan-Bench 评估中,其单物体抓取策略在 Unitree G1 上零样本部署成功率达73.3%,并扩展至多物体训练。

Comments Project website: this https URL (https://orayyan.com/fetchman)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22924 2026-08-19 cs.CV 版本更新

Layering Virtual Try-On

分层虚拟试穿

Chun Feng, Bowei Chen, Mengyi Shan, Ira Kemelmacher-Shlizerman

机构 * University of Washington(华盛顿大学)

AI总结 研究针对现实中服装分层搭配的虚拟试穿难题,提出LVTON方法。先通过自动数据生成管道训练获取一般VTON先验知识,再在专用数据集微调学习分层逻辑,在LVTON基准及传统VTON基准上取得优异成果,展现零样本能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12763 2026-08-19 cs.LG math.DS math.OC q-bio.NC 版本更新

Center-Manifold Reduction of Learning at Bifurcations: Interference and Rich Learning in Recurrent Neural Networks

状态空间NTK在接近分岔点时的坍缩

James Hazelden, Eric Shea-Brown

机构 * University of Washington(华盛顿大学)

AI总结 研究通过经验状态空间神经 tangent 核(sNTK)分析梯度下降在分岔点附近的动态,发现分岔点主导并简化了学习过程,通过分解sNTK揭示了高维递归系统的学习几何结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08525 2026-08-19 cs.AI cs.CL cs.CY 版本更新

Ads in AI Chatbots? An Analysis of How Large Language Models Navigate Conflicts of Interest

AI聊天机器人中的广告:大型语言模型如何应对利益冲突分析

Addison J. Wu, Ryan Liu, Shuyue Stella Li, Yulia Tsvetkov, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学)

AI总结 本文分析了大型语言模型在面临用户与公司利益冲突时的决策问题,通过实验发现多数模型优先考虑公司利益而非用户福祉,展示了在广告推荐中潜在的风险。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08713 2026-08-19 cs.AI cs.CV cs.RO 版本更新

Towards Unified World Models for Visual Navigation via Memory-Augmented Planning and Foresight

通过记忆增强的规划和前瞻性构建视觉导航的统一世界模型

Yifei Dong, Fengyi Wu, Guangyu Chen, Lingdong Kong, Qiyu Hu, Yuxuan Zhou, Xu Zhu, Jingdong Sun, Jun-Yan He, Qi Dai, Alexander G. Hauptmann, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) Apple(苹果公司) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出UniWM,一种整合视觉前瞻性与规划的统一世界模型,通过记忆机制提升导航鲁棒性和泛化能力,在多个基准测试中显著提升导航成功率。

Comments Accepted to ECCV 2026. 22 pages, 12 figures, code: this https URL (https://github.com/UWMILab/UniWM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01832 2026-08-19 cs.CL 版本更新

SCRIBES: Web-Scale Script-Based Semi-Structured Data Extraction with Reinforcement Learning

SCRIBES:基于脚本的网页级半结构化数据强化学习提取框架

Shicheng Liu, Kai Sun, Lisheng Fu, Xilun Chen, Xinyuan Zhang, Zhaojiang Lin, Rulin Shao, Yue Liu, Anuj Kumar, Wen-tau Yih, Xin Luna Dong

机构 * Stanford University(斯坦福大学) Meta Reality Labs(Meta现实实验室) FAIR at Meta(Meta的FAIR) University of Washington(华盛顿大学)

AI总结 SCRIBES是一种新型强化学习框架,利用同一网站内网页布局相似性生成可复用提取脚本,在脚本质量和下游问答准确率上均优于基线,实现高效网页级半结构化数据提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15454 2026-08-18 cs.AI 新提交

Dynamic Multi-Byte Prediction With Hierarchical Language Models

基于分层语言模型的动态多字节预测

Abraham Toluwase Owodunni, Chibuzor Okocha, Christan Grant, Tomasz Limisiewicz, Sachin Kumar

机构 * The Ohio State University(俄亥俄州立大学) University of Florida(佛罗里达大学) University of Washington(华盛顿大学)

AI总结 本文针对分层语言模型逐字节生成推理速度慢的问题,提出多字节预测方法,通过可变长度预测窗口与因果注意力掩码实现并行字节预测,在多任务中达成性能与吞吐量的最优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15008 2026-08-18 cs.CL 新提交

Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents

利用记忆:记忆智能体中记忆载体的整体评估

Wei-Chieh Huang, Weizhi Zhang, Yuchen Wu, Yankai Chen, Eric Hanchen Jiang, Wooseong Yang, Yiwei Yang, Henry Peng Zou, Hanrong Zhang, Ying Nian Wu, Haolun Wu, Kai-Wei Chang, Philip S. Yu, Xue Liu, Aylin Caliskan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Washington(华盛顿大学) McGill University(麦吉尔大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 该研究评估了记忆智能体的多种记忆载体,发现无通用最优载体,不同载体适配不同场景,为自适应智能体记忆系统设计提供了实证指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14624 2026-08-18 cs.AI 新提交

Learning Agent Execution for KV-Cache Management in Agentic Serving

面向智能体服务的KV缓存管理的智能体执行学习

Rui Zhang, Chaeeun Kim, Shaoting Feng, Kuntai Du, Yuhan Liu, Yi Zhong, Cheng-Wei Ching, Junchen Jiang, Liting Hu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Washington(华盛顿大学) University of Chicago(芝加哥大学)

AI总结 针对多智能体LLM服务中KV缓存复用不足的问题,提出CacheScout,通过在线学习智能体执行转换优化缓存管理,显著提升缓存命中率、降低延迟并提高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12253 2026-08-18 cs.CL cs.AI cs.LG 版本更新

One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL

单个冻结模拟器不够:多智能体强化学习中的模拟器崩溃问题

Simon Yu, Nicholas Tomlin, Marwa Abdulhai, Ximing Lu, Derek Chong, Abe Hou, Dilara Soylu, Sergey Levine, Christopher D. Manning, Weiyan Shi

机构 * Northeastern University(东北大学) New York University(纽约大学) UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 针对人机交互多智能体强化学习中单个LLM模拟器导致的策略泛化缺陷,提出Verbalized Sampling和Co-Training两种方案,在多轮基准测试和真实用户研究中显著提升了性能,发布了开源框架SCOPE。

Comments 42 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03988 2026-08-18 cs.AI 版本更新

Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models

想象感知标记增强多模态语言模型的空间推理能力

Mahtab Bigverdi, Linjie Li, Weikai Huang, Yiming Liu, Jaemin Cho, Tuhin Kundu, Chris Dongjoo Kim, Zelun Luo, Jieyu Zhang, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(Allen人工智能研究所) Microsoft(微软) OpenAI(开放人工智能研究院)

AI总结 提出想象感知标记(IPT)作为中间感知表征,通过监督学习提升多模态语言模型在不可见视角推理、遮挡路径追踪等空间推理任务上的性能,在三个新构建的数据集上优于文本思维链训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04535 2026-08-18 cs.LG cs.DC 版本更新

FDA-Opt: Federated Fine-Tuning via Dynamic Update Schedules

高效通信的联邦微调

Michael Theologitis, Vasilis Samoladas, Antonios Deligiannakis

机构 * University of Washington(华盛顿大学) Technical University of Crete(希腊塞萨洛尼基技术大学)

AI总结 本文提出FDA-Opt算法,解决联邦学习中参数通信频繁和刚性的难题,通过统一FDA和FedOpt方法,提升语言模型在下游NLP任务中的微调性能。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24575 2026-08-18 cs.CV cs.AI 版本更新

VFIG: Vectorizing Complex Figures in SVG with Vision-Language Models

VFIG:利用视觉-语言模型矢量化SVG中的复杂图形

Qijia He, Xunmei Liu, Hammaad Memon, Ziang Li, Zixian Ma, Jaemin Cho, Zhongzheng Ren, Daniel S Weld, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能 Allen 机构) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出VFIG,一种基于视觉-语言模型的矢量化方法,通过大规模数据集和分层训练策略,实现复杂图形到SVG的高保真转换,并在基准测试中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14016 2026-08-17 cs.CV cs.AI cs.GR 新提交

Content Based Video Narration of Gameplay with Vision Language Models

基于内容的游戏玩法视频旁白:利用视觉语言模型

Mathew Varghese

机构 * University of Washington(华盛顿大学)

AI总结 该研究提出一种基于内容的游戏玩法视频旁白系统,利用视觉语言模型等技术生成电竞风格解说,无需游戏专用工具,支持本地化语音,还发布了可复现基线。

Comments https://mathewvarghese.space/ai-powered-game-commentary-auto-narrating-gameplay-videos-with-gpt-4o/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11368 2026-08-14 cs.LG 版本更新

PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR

PAIR:用于RLVR中自适应rollout分配的成对感知包含重加权方法

Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学)

AI总结 针对RLVR中自适应rollout分配的统计不匹配问题,提出PAIR方法,通过成对对比图校正梯度估计,在Qwen3模型上提升准确率同时减少token使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10860 2026-08-14 cs.RO cs.CV 版本更新

Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility

Flex-$π$:具备计算灵活性的多流世界-动作模型

Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

AI总结 该研究提出Flex-$π$多流世界-动作模型,利用冻结的视频生成VAE实现多模态监督,通过混合专家Transformer与每流丢弃机制提升效率,在双臂操作任务上性能优于基线模型且运行更快。

Comments Project page: https://flex-pi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09164 2026-08-14 cs.AI 版本更新

CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment

CIDER:用于隐私偏好对齐的上下文披露边界数据集

Bingcan Guo, Eryue Xu, Jijie Zhou, Zhiping Zhang, Tianshi Li

机构 * University of Washington(华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Northeastern University(东北大学)

AI总结 本文推出包含169名用户标注的CIDER数据集,用于评估LLM隐私偏好对齐,发现上下文个性化可提升预测准确率,GPT-5.4和Claude Sonnet 4.6表现更优。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12185 2026-08-13 cs.CV 新提交

GenFAR: A generalized representation of brain structure, derived from 49,246 multi-cohort MRIs via deep learning

GenFAR:基于49246例多队列MRI通过深度学习得到的脑结构通用表征

Vishnu M. Bashyam, Guray Erus, Junhao Wen, Pratik Chaudhari, Randa Melhem, Sindhuja Govindarajan Tirumalai, Gareth Harman, Yong Fan, Colin L. Masters, Paul Maruff, Sterling C. Johnson, Jurgen Fripp, Duygu Tosun, John C. Morris, Daniel S. Marcus, Pamela LaMontagne, Tammie Benzinger, Susan R. Heckbert, Mark Espeland, Marilyn S. Albert, Andrew J. Saykin, Paul M. Thompson, Timothy J. Hohman, Susan M. Resnick, R. Nick Bryan, Murat Bilgel, Yang An, David A. Wolk, Li Shen, Haochang Shou, Ilya M. Nasrallah, Christos Davatzikos

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Melbourne(墨尔本大学) University of Wisconsin School of Medicine and Public Health(威斯康星大学医学与公共卫生学院) CSIRO Health and Biosecurity(联邦科学与工业研究组织健康与生物安全部) CSIRO(联邦科学与工业研究组织) University of California, San Francisco(加利福尼亚大学旧金山分校) Washington University in St. Louis(圣路易斯华盛顿大学) University of Washington(华盛顿大学) Wake Forest School of Medicine(维克森林医学院) Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院) Indiana University(印第安纳大学) University of Southern California(南加利福尼亚大学)

AI总结 GenFAR是基于49246例多队列MRI的模块化深度学习框架,通过17类任务训练得到通用脑表征,可提升二级预测器的样本效率与准确性

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12236 2026-08-13 cs.RO cs.AI cs.LG 版本更新

TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

TMRL: 差分时间步调节预训练实现高效策略微调的探索

Matthew M. Hong, Jesse Zhang, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Amazon FAR(亚马逊FAR)

AI总结 本文提出TMRL框架,通过结合行为克隆预训练与强化学习微调,解决预训练中动作分布狭窄的问题,提升机器人策略微调的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12283 2026-08-13 cs.AI cs.MA 版本更新

Deep Fictitious Play-Based Potential Differential Games for Learning Human-Like Interaction at Unsignalized Intersections

基于深度虚拟博弈的势微分博弈:用于学习无信号交叉口的类人交互

Kehua Chen, Ryan Feng Lin, Shucheng Zhang, Yinhai Wang

机构 * Department of Civil and Environmental Engineering, University of Washington(华盛顿大学土木与环境工程系)

AI总结 本研究提出DFP-PDG框架,首次用深度虚拟博弈学习无信号交叉口类人交互驾驶策略,经INTERACTION数据集验证有效,可捕捉驾驶风格差异并保证收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10296 2026-08-12 cs.CL 新提交

Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension

基础的裂痕:看似微小的架构选择会影响长上下文扩展

Amanda Bertsch, Luca Soldaini, Matthew R. Gormley, Graham Neubig, Hannaneh Hajishirzi, Kyle Lo, Dirk Groeneveld

机构 * Ai2 Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

AI总结 该研究发现,Olmo、Llama、Qwen等稠密模型系列的四个微小架构决策会复合降低长上下文性能,结合三个及以上选择可使性能降47%,经17万余GPU小时训练发布OlmPool,其部分模型长上下文性能优于Llama 3。

Comments 29 pages; accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10251 2026-08-12 cs.CL cs.LG 新提交

Off-Axis, On Purpose: Where a Transformer Computes Concepts and Why it Does So

离轴,出于目的:Transformer在何处计算概念以及为何如此计算

Mark Oskin

机构 * University of Washington(华盛顿大学) School of Computer Science and Engineering(计算机科学与工程学院)

AI总结 该研究揭示Transformer分两阶段计算,概念阶段采用与读取轴近乎正交的子空间,强制该几何结构可提升稀疏旋转的收敛性,且不损害语言建模基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09273 2026-08-12 cs.LG 版本更新

Instance-Adaptive Online Multicalibration

实例自适应在线多校准

Zhiming Huang, Jamie Morgenstern, Aaron Roth, Claire Jie Zhang

机构 * Paul G. Allen School of Computer Science and Engineering, University of Washington(华盛顿大学保罗·G·阿伦计算机科学与工程学院) Department of Computer and Information Sciences, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系)

AI总结 本文提出了一种高效的实例自适应在线多校准算法,通过动态调整预测值的二进制网格来平衡最坏情况和易处理情况,实现了在不同实例下的最优误差控制。

Comments Affiliation update only; no changes to technical content

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21436 2026-08-12 stat.ML cs.GT cs.LG 版本更新

Efficient Uncoupled Learning Dynamics with $\tilde{O}\!\left(T^{-1/4}\right)$ Last-Iterate Convergence in Bilinear Saddle-Point Problems over Convex Sets under Bandit Feedback

在带凸集的双线性鞍点问题中实现高效解耦学习动力学,具有$\tilde{O}\!\left(T^{-1/4}\right)$的最后迭代收敛性

Arnab Maiti, Claire Jie Zhang, Kevin Jamieson, Jamie Heather Morgenstern, Ioannis Panageas, Lillian J. Ratliff

机构 * University of Washington(华盛顿大学) University of California, Irvine(加州大学尔湾分校)

AI总结 本文提出了一种高效的解耦学习算法,在双线性鞍点问题中实现$\tilde{O}(T^{-1/4})$的最后迭代收敛性,通过结合实验设计和FTRL框架,利用定制正则化函数以高概率收敛到纳什均衡。

Comments 19 pages, accepted at AISTATS 2026. Affiliation update only; no changes to technical content

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05307 2026-08-12 cs.CL 版本更新

MentorCollab: Large-to-Small Inference-Time Mentorship for Concise Reasoning in Language Models

MentorCollab: 选择性大到小推理时指导以实现高效推理

Haojin Wang, Yike Wang, Shangbin Feng, Hannaneh Hajishirzi, Yulia Tsvetkov

机构 * UIUC(伊利诺伊大学香槟分校) University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

AI总结 MentorCollab通过选择性推理时指导,使小型模型在多步骤推理任务中实现高效协作,提升性能的同时降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08566 2026-08-11 cs.CV cs.AI 新提交

On-Device Multi-Species Malaria Detection with Uncertainty-Calibrated Slide-Level Aggregation

基于不确定性校准的玻片级聚合的设备端多物种疟疾检测

Idaya Seidu, Ahmed Tahiru Issah, Charles B. Delahunt, Carine Mukamakuza

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校) University of Washington(华盛顿大学)

AI总结 针对资源有限地区疟疾检测的临床约束,开发基于YOLOv13n的设备端多物种疟疾检测系统,满足多物种鉴别等要求,在2739张图像上实现较高检测精度与聚合性能。

Comments Accepted at The Fifth Workshop on Applications of Medical AI (AMAI) 2026, a satellite event at MICCAI 2026. To appear in Springer Lecture Notes in Computer Science (LNCS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07886 2026-08-11 cs.CV cs.AI cs.CL 新提交

Vision-Language Grounding as Bidirectional Concept Correspondence

视觉-语言 Grounding 作为双向概念对应

Jieyu Zhang, Ziqi Gao, Luke Zettlemoyer, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所) FAIR at Meta(Meta FAIR实验室)

AI总结 本研究将视觉-语言 Grounding 建模为双向概念对应,提出 ConCor-1 模型统一相关任务,在长文本数据集和零样本 LVIS 上对应 F1 分别提升 48%、29%,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏