arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2603.16809 2026-07-07 cs.RO cs.AI 版本更新 79%

CABTO: Context-Aware Behavior Tree Grounding for Robot Manipulation

CABTO:面向机器人操作的上下文感知行为树接地

Yishuai Cai, Xinglin Chen, Yunxin Mao, Kun Hu, Yaodong Yang, Yuanpei Chen, Wenjing Yang, Ji Wang, Minglong Li

机构 * National University of Defense Technology(国防科技大学) PsiBot Peking University(北京大学) PKU-Psibot Lab(北京大学-PsiBot实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出CABTO框架,通过预训练大模型和上下文反馈,自动构建完整且一致的行为树系统,解决机器人操作中行为树接地的复杂性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01049 2026-07-02 cs.CV 新提交 79%

GenAU: Language-Grounded Industrial Anomaly Understanding with Vision-Language Models

GenAU: 基于语言的工业异常理解与视觉语言模型

Hongkuan Zhou, Tristan Rehm, Nadeem Nazer, Lavdim Halilaj, Jingcheng Wu, Steffen Staab

机构 * Corporate Research, Robert Bosch GmbH(罗伯特·博世有限公司企业研究部) Otto-von-Guericke-University Magdeburg(马格德堡奥托·冯·格里克大学) University of Southampton(南安普顿大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 提出GenAU框架,统一图像级检测、像素级分割、多类型异常检测和缺陷分析,通过两个分割标记实现语言引导的定位,在VisA和Real-IAD上取得最优零样本检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31980 2026-07-02 cs.CL cs.AI cs.HC 新提交 79%

DigitalCoach: Communication and Grounding Gaps in Human and Agentic Computer Use Coaching

DigitalCoach:人类与智能体计算机使用辅导中的沟通与基础差距

Meng Chen, Anya Ji, Tsung-Han Wu, Tobias Maringgele, David M. Chan, Alane Suhr, Amy Pavel

机构 * University of California, Berkeley(加州大学伯克利分校) Technical University of Munich(慕尼黑工业大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 提出DigitalCoach数据集,包含72次人机辅导会话,评估模型在计算机使用教学中的表现,发现模型在解释、错误诊断和视觉基础方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12009 2026-07-02 cs.CV 版本更新 79%

Affogato: Open-Vocabulary Affordance Grounding with Automated Data Generation at Scale

Affogato: 基于大规模自动数据生成的开词汇可操作区域定位

Junha Lee, Eunha Park, Chunghyun Park, Dahyun Kang, Minsu Cho

机构 * Pohang University of Science and Engineering (POSTECH)(浦项科技大学) SqueezeBits RLWLRD

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 提出Affogato框架,通过自动化流程生成750K 3D可操作区域热力图与自然语言查询对,解决数据瓶颈,实现开词汇可操作区域定位,并验证其跨架构迁移能力。

Comments ECCV 2026, Project page: https://junha-l.github.io/affogato/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31338 2026-07-01 cs.SD cs.AI eess.AS 新提交 79%

Beyond Binary Instrument QA: Probing Instrument Grounding in Music Audio-Language Models

超越二元乐器问答:探究音乐音频-语言模型中的乐器接地

Yujun Lee, Joonhyeok Shin, Hyoeun Kim, Kyuhong Shim

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文通过多轴诊断基准测试发现,音乐音频-语言模型在二元乐器问答中的高准确率常掩盖选项位置偏差、易混淆乐器错误和时间响应偏差等问题,表明乐器接地评估需采用多维度基准而非单一准确率。

Comments Workshop on Machine Learning for Audio, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26567 2026-07-01 cs.CV 版本更新 79%

AirZoo: A Unified Large-Scale Dataset for Grounding Aerial Geometric 3D Vision

AirZoo: 一种用于地面几何3D视觉的统一大规模数据集

Xiaoya Cheng, Rouwan Wu, Xinyi Liu, Zeyu Cui, Yan Liu, Na Zhao, Yu Liu, Maojun Zhang, Shen Yan

机构 * National University of Defense Technology(国防科技大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出AirZoo数据集,通过可扩展生成流程、全面场景多样性和丰富的几何标注,解决无人机感知中复杂视角变换和环境条件的挑战,验证其在三维重建和图像检索中的有效性。

Comments ECCV 2026. Project page: https://nudt-sawlab.github.io/AirZoo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24561 2026-07-01 cs.CV 版本更新 79%

RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios

RGBT-GroundBench: 超越RGB的复杂真实世界场景中的视觉定位

Tianyi Zhao, Jiawen Xi, Linhui Xiao, Junnan Li, Xue Yang, Maoxun Yuan, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学人工智能研究院、虚拟现实技术与系统国家重点实验室) Pengcheng Laboratory(鹏城实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 提出首个大规模RGB-热红外视觉定位基准RGBT-GroundBench,包含4万+图像和3级细粒度标注,统一评估协议支持RGB/热红外/融合输入,揭示低照度下性能显著下降,并引入参考基线RGBT-VGNet。

Comments 40pages, 9figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23294 2026-06-30 cs.CV 79%

Towards Long-Form Spatio-Temporal Video Grounding

面向长形式时空视频定位

Xin Gu, Bing Fan, Jiali Yao, Zhipeng Zhang, Yan Huang, Cheng Han, Heng Fan, Libo Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出ART-STVG方法,针对长时视频中的目标定位问题,通过自回归Transformer架构和记忆银行设计,提升对长视频中时空信息的处理能力,实验表明其在长形式STVG任务中优于现有方法。

Comments 22 pages, 11 figures. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26519 2026-06-29 cs.AI 新提交 79%

What the LLM Should Not Say: Boundary-Aware Context Grounding for A Seven-Channel EEG Agent

面向低通道EEG智能体的边界感知上下文接地

Zhiyuan Xu, Yueqing Dai, Junling Li, Junwen Luo

机构 * Shanghai Pulse Element Intelligent Technology Co., Ltd. (NeuraDock)(上海脉冲元素智能科技有限公司(NeuraDock))

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 提出NeuraDock Agent架构,通过分离确定性本地EEG引擎与硬件感知语言层,实现LLM对低通道EEG数据的边界感知接地,经288次测试验证了系统在数值重复性、故障恢复和边界感知方面的有效性。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05663 2026-06-29 cs.CV 版本更新 79%

Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding

保持证据链:面向视频时序定位的无训练令牌剪枝的语义证据分配

Jiaqi Li, Shuntian Zheng, Yixian Shen, Jia-Hong Huang, Xiaoman Lu, Minzhe Ni, Yu Guan

机构 * University of Warwick(沃里克大学) University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 提出SemVID无训练剪枝框架,通过证据保留和连接强度原则选择对象、运动和上下文令牌,在仅保留12.5%视觉令牌时保持95.4% mIoU,实现5.8倍预填充加速。

Comments Project at https://jiaqili404.github.io/SemVID

Journal ref The 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01085 2026-06-25 cs.CV cs.CL 版本更新 79%

Generalised Medical Phrase Grounding

通用医学短语定位

Wenjun Zhang, Shekhar S. Chandra, Aaron Nicolson

机构 * The University of Queensland(昆士兰大学) Australian e-Health Research Centre, CSIRO Health and Biosecurity(澳大利亚电子健康研究中心,CSIRO健康与生物安全)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对现有医学短语定位方法无法处理多区域、非诊断性及不可定位短语的问题,提出通用医学短语定位任务及MedGrounder模型,采用两阶段训练策略,在零样本迁移和多区域/不可定位短语上优于基线方法。

Comments Accepted by IEEE Transactions on Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21195 2026-06-23 cs.CL cs.AI 新提交 79%

Beyond Hooking Onto the World: Referential Profiles and the Numerical Structure of LLM Grounding

超越钩连世界:指称轮廓与LLM基础的数字结构

Joo Yull Rhee

机构 * Sungkyunkwan University(成均馆大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文重新审视大语言模型的基础问题,提出指称是基于轮廓、上下文敏感、受情感影响且受规范约束的,并通过优化将语言痕迹参数化为数字结构,支持LLM拥有衍生性、语言中介的指称形式。

Comments 29 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03579 2026-06-23 cs.RO cs.LG 版本更新 79%

Intent-Handover: Grounding Language in Human-Usage Regions for Trustworthy Robot-to-Human Handovers

Intent-Handover:在人类使用区域中接地语言以实现可信的机器人到人交接

Hanxin Zhang, Abdulqader Dhafer, Hongbiao Dong, Zhou Daniel Hao

机构 * DANiLab, University of Leicester(莱斯特大学DANiLab) University of Leicester(莱斯特大学) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院) School of Metallurgy and Materials, University of Birmingham(伯明翰大学冶金与材料学院)

专题命中 视觉定位与Grounding :grounding(title);vision-language model(abstract);分类 cs.LG

AI总结 提出Intent-Handover方法,通过视觉语言模型识别目标物体和人类使用区域,结合抓取优化和人体姿态跟踪,实现安全、可信的机器人到人物体交接。

Comments Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18947 2026-06-18 cs.AI cs.CL cs.IR cs.MA 新提交 79%

Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents

将搜索与推理解耦:面向LLM Agent的供应商无关的接地架构

Emmanuel Aboah Boateng, Kyle MacDonald, Amardeep Kumar, Siddharth Kodwani, Sudeep Das

机构 * DoorDash, Inc.(DoorDash公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 提出解耦搜索接地(DSG)架构,将搜索接地从推理模型中分离,通过MCP兼容网关实现供应商路由、缓存等控制,在降低成本和延迟的同时保持或提升准确性。

Comments 15 pages, Figure 8

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16432 2026-06-16 cs.CL cs.AI 新提交 79%

ACCORD: Action-Conditioned Contextual Grounding for Language Agents

ACCORD: 面向语言智能体的动作条件上下文接地

Lai Jiang, Cheng Qian, Zhenhailong Wang, Pan Lu, Heng Ji, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 针对用户指令常因隐含环境假设而欠指定,导致LLM智能体执行失败的问题,提出ACCORD框架,在每次动作前主动探测缺失信息并整合轨迹上下文,无需额外训练,在AppWorld和AlfWorld上显著提升任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12767 2026-06-12 cs.AI 新提交 79%

Constructing Evaluation Datasets for Procedural Reasoning: Balancing Naturalness, Grounding, and Multi-Hop Coverage

构建程序性推理评估数据集:平衡自然性、基础性和多跳覆盖

Sarah Elshabrawy, Rahul K. Dass, Ashok K. Goel

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 研究基于任务-方法-知识(TMK)模型的问题生成策略对程序性和多跳推理数据集质量的影响,提出基础性验证框架,发现严格TMK生成策略在基础性和可用性上最优。

Comments 10 pages, 2 numbered figures. Workshop submission to HAIL @ AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10359 2026-06-10 cs.AI 新提交 79%

ReflectiChain: Epistemic Grounding in LLM-Driven World Models for Supply Chain Resilience

ReflectiChain: 面向供应链韧性的LLM驱动世界模型中的认知基础

Jia Luo

机构 * School of Foreign Languages, Huazhong University of Science

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 提出ReflectiChain框架,通过生成式供应链世界模型和双环学习分离认知不确定性与偶然不确定性,在半导体基准上提升推理一致性33.0%,并在对抗冲击下保持82.3%可操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07415 2026-06-10 cs.CV cs.CL 版本更新 79%

ChartREG++: Towards Benchmarking and Improving Chart Referring Expression Grounding under Diverse referring clues and Multi-Target Referring

ChartREG++:面向多样化指代线索和多目标指代的图表指代表达式定位基准与改进

Tianhao Niu, Ziyu Han, Xuan Dong, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对现有图表指代表达式定位基准的局限,提出支持多种定位形式、多目标指代、多样化线索和图表类型的基准,并利用代码驱动合成流水线生成像素级实例掩码,训练实例分割模型集成到多模态定位框架,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09248 2026-06-09 cs.CV 新提交 79%

Temporal-Aware Reasoning Optimization for Video Temporal Grounding

时间感知推理优化用于视频时间定位

Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 提出TaRO框架,通过构造性推理探索和时间敏感性奖励,增强多模态大模型在视频时间定位中的时间感知推理能力,实现最先进性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07999 2026-06-09 cs.AI 新提交 79%

Efficient Skill Grounding via Code Refactoring with Small Language Models

通过小型语言模型的代码重构实现高效技能落地

Sera Choi, Wonje Choi, Saehun Chun, Daehee Lee, Jooyoung Kim, Chaeun Lee, Honguk Woo

机构 * KAIST(韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 提出RECENT框架,通过将技能语义与执行绑定解耦,利用小型语言模型进行代码重构实现高效技能落地,在动态环境中达到与大型语言模型相当的性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13796 2026-06-04 cs.CL cs.CV 79%

The Mechanistic Emergence of Symbol Grounding in Language Models

语言模型中符号接地机制的涌现

Shuyu Wu, Ziqiao Ma, Xiaoxi Luo, Yidong Huang, Josue Torres-Fonseca, Freda Shi, Joyce Chai

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 通过机械因果分析,发现符号接地在语言模型的中层计算中通过注意力头聚合环境信息实现,并在多模态对话和多种架构中复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02555 2026-06-04 cs.CV cs.CL 79%

High-Quality Entity Segmentation and Grounding

高质量实体分割与定位

Lu Qi, Yi-Wen Chen, Tao Zhang, Xiangtai Li, Xu Yang, Bo Du, Ming-Hsuan Yang

机构 * Wuhan University(武汉大学) Insta360 Research(Insta360研究院) Department of EECS, University of California, Merced(加州大学默塞德分校电子工程与计算机科学系) Nanyang Technological University(南洋理工大学) Institute of Automation of the Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 提出ESG流水线,通过新数据集EntitySeg和两阶段解耦设计(CropFormer高质量分割+GELLA精确名词提取与语义匹配),实现高质量实体分割与定位,在五项任务上有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03539 2026-06-03 cs.CV 79%

Knowledge-Preserved Model Tuning in Null-Space for Robust Spatio-Temporal Video Grounding

零空间中知识保留的模型调优用于鲁棒的时空视频定位

Haoxuan Chen, Xianqin Liu, Jian-Fang Hu

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) National Information Center of GACC (Guangdong), GuangZhou, China(广东省GACC国家信息中心) Guangdong Province Key Laboratory of Information Security Technology, China(广东省信息安全技术重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与高级计算重点实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对低质量视频导致预训练知识被破坏的问题,提出零空间调优(NST)框架,通过将可学习残差限制在冻结权重的零空间内来保留预训练知识,同时利用质量自适应单元和双空间重参数化合成残差,在混合质量基准上达到最优性能。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00556 2026-06-02 cs.CV 79%

Improving Visual Grounding in Remote Sensing via Cluster-Guided Refinement and Model Ensemble Voting

通过聚类引导精炼和模型集成投票改进遥感中的视觉定位

Panav Shah, Geet Sethi, Ashutosh Gandhe

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 提出两种视觉定位流程(SGR和CGR),结合遥感专用模型RemoteSAM和通用分割模型SAM3,并通过多模型集成投票提升定位精度。

Comments Accepted at CVPR 2026 Workshop MORSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30742 2026-06-01 cs.CV 79%

Annotations Are Not All You Need: A Cross-modal Knowledge Transfer Network for Unsupervised Temporal Sentence Grounding

注释并非全部所需:面向无监督时间语句定位的跨模态知识迁移网络

Xiang Fang, Daizong Liu, Wanlong Fang, Pan Zhou, Yu Cheng, Keke Tang, Kai Zou

机构 * Hubei Key Laboratory of Distributed System Security(湖北分布式系统安全重点实验室) Hubei Engineering Research Center on Big Data Security(湖北大数据安全工程研究中心) School of Cyber Science and Engineering(网络安全学院) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Henan University(河南大学) The Chinese University of Hong Kong(香港中文大学) Guangzhou University(广州大学) Protagolabs Inc.(Protagolabs公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 提出跨模态知识迁移网络,通过从图像-名词和视频-动词任务中迁移实体感知和事件感知知识,实现无监督时间语句定位,无需配对视频-查询标注。

Comments Published in Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26711 2026-06-01 cs.CL cs.LG 79%

The Need for an External Observer Formalizing the Sufficiency Gap: A Mathematical Extension of Mixture Identifiability and Contextual Grounding in Sequence Models

外部观察者的必要性:充分性差距的形式化——序列模型中混合可识别性与上下文基础化的数学扩展

Francesco Corielli

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 本文通过构建二元混合过程,形式化了由未观测隐状态导致的充分性差距,并引入辅助信号建立上下文主导阈值,证明温度缩放无法弥补缺失上下文,而外部观察者或验证器在高风险领域是必要的。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30352 2026-05-29 cs.CV 79%

GMOS: Grounding Moving Object Segmentation in 3D Space and Time

GMOS: 在3D空间和时间中定位运动物体分割

Junyu Xie, Tengda Han, Weidi Xie, Andrew Zisserman

机构 * Visual Geometry Group, Department of Engineering Science, University of Oxford, UK(牛津大学工程科学系视觉几何组) SAI, Shanghai Jiao Tong University, China(上海交通大学SAI)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 提出GMOS框架,直接在RGB视频上实现3D感知、时间细粒度的多运动物体分割,并构建GMOS-2K数据集和MOS-I评估协议,在多个基准上取得最先进结果。

Comments Project Page: https://www.robots.ox.ac.uk/vgg/research/gmos/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29858 2026-05-29 cs.CV 79%

Masked Diffusion Vision-Language Models for Temporal Action Localization

用于时序动作定位的掩码扩散视觉语言模型

Fengshun Wang, Zhengbo Zhang, Zhigang Tu

机构 * Wuhan University(武汉大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 提出掩码扩散视觉语言模型(MDVLM)用于时序动作定位,通过双向注意力迭代去噪联合优化语义和边界,并引入边界感知掩码和步级IoU奖励解决训练不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29826 2026-05-29 cs.CL cs.AI 79%

Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models

面向多模态大语言模型的局部化与解耦知识编辑

Leijiang Gu, Zhen Zeng, Feng Li, Xinjian Gao, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Tongji University(同济大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.AI

AI总结 针对多模态知识编辑中因果错位和特征纠缠问题,提出LDKE框架,通过快速定位关键层和解耦分类器实现精准泛化编辑并保持高局部性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29300 2026-05-29 cs.CL cs.AI cs.SD 79%

MusTBENCH: Benchmarking and Advancing Temporal Grounding in Music LLMs

MusTBENCH:音乐大语言模型中的时间定位基准与推进

Daeyong Kwon, Qiyu Wu, Shinobu Kuriya, Junghyun Koo, Shuyang Cui, Zhi Zhong, Wei-Hsiang Liao, Hiromi Wakaki, Yuki Mitsufuji

机构 * Seoul National University(首尔国立大学) Sony Group Corporation(索尼集团) Sony AI(索尼人工智能)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 提出MusTBENCH基准和MusT四阶段优化方法,评估并提升音乐大语言模型在音频中的时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏