Refnd: Preventing Data Leakage in Relational Datasets
Refnd:防止关系型数据集中的数据泄露
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 研究针对生化数据机器学习模型评估时因未考虑关系结构致数据泄露问题,提出基于关系生成过程的Refnd划分算法,利用HNSW快速计算近邻图,在抗菌肽数据集验证,性能评估更现实且适用多种数据集。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
Refnd:防止关系型数据集中的数据泄露
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 研究针对生化数据机器学习模型评估时因未考虑关系结构致数据泄露问题,提出基于关系生成过程的Refnd划分算法,利用HNSW快速计算近邻图,在抗菌肽数据集验证,性能评估更现实且适用多种数据集。
PercepCap:具有结构化时空感知的视频字幕生成器
机构 * Nanjing Univerisity(南京大学) ; Kuaishou Technology(快手科技) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 研究视频字幕生成问题,提出PercepCap框架,遵循感知-描述生成链,设计两阶段训练策略及相关数据构建方法,在评估中优于基线,提升视频字幕生成质量。
尽早检测,极少升级:从压缩比特流中随时检测人工智能生成的视频
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 研究从压缩比特流中随时检测人工智能生成视频的问题,核心方法是将任务重定义为流感知并对运动场评分,贡献是重新构建、两个保证及测量前沿,在GenVidBench等上取得较好效果。
OmniReasoner:通过原生工具使用进行长音频-视频推理
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 针对长音频-视频推理难题,OmniReasoner提出工具使用后训练框架,通过监督微调与强化学习让全模态语言模型学会调用放大工具,利用TimeAnchor保持时间参数一致性,借助时间增强数据引擎实现可训练,提升了答案准确性与时间定位能力。
MIRA-Ev:临床考试中颗粒证据检测和关系推理的基准
机构 * HiTZ Center, University of the Basque Country (EHU)(巴斯克大学HiTZ中心) ; Hospital Universitario de Cruces(克鲁塞斯大学医院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究针对临床自然语言处理评估局限,引入基于西班牙MIR执照考试案例的MIRA-Ev基准,重新注释相关关系并发布多语言版本,将评估组织为证据句子检索、论证组件提取和关系分类的三层任务层次结构。
CR-Refiner:用于编辑条件3D场景检索的以对象为中心的最优传输重排器
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 研究编辑条件3D场景检索问题,提出CR-Refiner重排器,通过冻结语言模型解析编辑、不平衡最优传输问题评分候选对象、轴条件结构先验及语言模型验证器细化结果,在不同基础检索器上提升了硬子集检索指标。
Mi-Memory:一种用于个人人工智能的生命周期内存框架
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究针对个人人工智能从聊天交互拓展至多设备持续服务的需求,提出Mi-Memory生命周期内存框架,围绕四个角色构建,通过共享审计合约及相关工件家族实现,经实例化角色在评估中取得一定成果,迈向可审计等特性的内存系统。
Comments Project page: https://darwin-agent.github.io/Mi-Memory/
UniETP:统一用于通用具身任务规划的环境
机构 * Peking University(北京大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 针对具身任务规划中模拟器和数据集孤立的问题,提出UniETP统一接口,整合四个常用模拟器,兼具标准化与多样性,构建新数据集,通过实验评估模型具身规划能力并分析瓶颈。
Comments We are actively working on releasing the codes and data
从人类视角理解:用于交互式自我中心医学图像分割的多智能体系统
机构 * School of Instrument Science and Engineering, Southeast University(东南大学仪器科学与工程学院) ; School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Sichuan University-Pittsburgh Institute, Sichuan University(四川大学匹兹堡学院) ; Department of Biomedical Engineering, Case Western Reserve University(凯斯西储大学生物医学工程系)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 研究交互式自我中心医学图像分割面临的挑战,提出EgoMed-Agent多智能体系统,通过目标确认和定位引导传播工作流程从人类视角理解目标,实验显示该系统平均Dice远超基线,效果显著。
从感知到协助:用于机器人操作的开放词汇共享自主性
机构 * University of São Paulo(圣保罗大学) ; Instituto Israelita de Ensino e Pesquisa Albert Einstein(以色列爱因斯坦教育与研究机构) ; Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 研究针对工业环境中机器人操作难题,提出共享自主性框架,利用RGB-D摄像头、视觉语言模型等,经GPU加速控制器等实现操作,在四足移动操纵器上验证,在多项任务中表现良好,展示了该框架的有效性。
ReqGenX:对遗留SRS文档的原子分解、工件再生和重建的实证研究
机构 * Texas State University(德克萨斯州立大学) ; Case Western Reserve University(凯斯西储大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究旨在将遗留SRS文档转化为可追溯工件,以细粒度评估基于大语言模型的SRS生成。方法是用ReqGenX进行实证研究,包括分解、投票、生成工件等步骤。结果表明该方法有效,能支持评估并揭示相关权衡。
Comments Accepted at the International Symposium on Empirical Software Engineering and Measurement (ESEM) technical papers (main) track 2026
CAMMAR:用于隐喻阿拉伯语表示的文化感知套娃
机构 * Autonomous University of Madrid (UAM)(马德里自治大学) ; IE University(IE大学) ; Oviedo University(奥维耶多大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究针对阿拉伯语语言模型语义模糊问题,提出CAMMAR框架,通过分阶段语义课程组织意义到嵌套子空间,基于词汇与隐喻表示距离产生隐喻性几何度量,在新数据集上评估,有监督时检测隐喻效果好,还发现基于形态学词根有提升。
Comments 14 pages, 5 figures
通过动作单元和动作检测引导实现文本到运动的逐笔画时间控制
机构 * Seoul National University(首尔国立大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 研究文本到运动模型中笔画落点时间不可靠问题,引入动作单元,通过轻量级门控适配器构建主干并利用无训练分类器梯度消除误差,在StrokeBench上测量,提高了正确放置单个笔画比率,核心帧成为可控轴。
用于检测引导的乳腺钼靶病变分类的区域基础视觉语言学习
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 针对乳腺钼靶病变分类,提出区域基础视觉语言学习方法,先通过区域-文本对比预训练对齐特征,引入多组件目标减轻偏差,再联合优化辅助病变检测头,实验表明该方法在多设置下性能优于相关方法。
广义少样本基准上的无训练开放词汇3D点云分割
机构 * University of Ghana(加纳大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 研究广义少样本3D点云分割问题,提出无训练方法,用冻结的3D视觉语言模型与概念分割器,通过跨视图一致性协调,在ScanNet200和ScanNet++基准上提升新类mIoU,且无需少样本支持,效果优于现有方法。
AdaTurn:用于主动视觉感知智能体的预算感知测试时缩放
机构 * University of Rochester(罗切斯特大学) ; Univeristy of Michigan(密歇根大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 研究主动视觉感知智能体在不同预算下的任务执行问题,提出AdaTurn框架,通过强制答案DAPO等组件,根据预算调整智能体行为,提高低预算准确率,且能有效转移到多基准测试中。
NeuroGRIP:用于基于知识的脑电图癫痫诊断的检索增强图细化
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 研究针对脑电图癫痫诊断难题,提出NeuroGRIP框架,结合外部医学知识校准脑电图图。通过构建知识库、利用大语言模型提取知识图,经对齐感知查询和相似性搜索检索关系证据,提升诊断准确性与可解释性,为临床诊断提供新框架。
人工智能智能体并非独自失败:上下文首先失败
机构 * The University of Chicago(芝加哥大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究人工智能智能体可靠性,通过ProofAgent-Harness评估上下文七个标准,验证上下文工程质量是智能体可靠性的领先指标,经受控研究表明上下文质量标准可预测行为结果,确立其为预检信号及可审计层。
Comments 24 pages, 1 figure
UESF-Bench:统一的具身寻找与跟随的基准测试与探究
机构 * Shandong University(山东大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Qilu University of Technology(齐鲁工业大学) ; Xiaomi Inc(小米公司) ; Beijing University Of Technology(北京工业大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究针对现有具身智能体语言引导人类跟随基准测试的局限,引入UESF-Bench基准,提出SeekFollow-VLA框架,可处理语义引导探索等任务,实验显示该框架在单人和多人环境中比基线有明显改进,为统一具身寻找与跟随建立基线。
局部冗余:一种基于合成记忆的可塑性信息论度量
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 研究神经网络可塑性度量,引入基于通用压缩理论的局部冗余,将其定义为局部模型族最坏情况冗余,证明期望平方梯度范数可作下界,实验表明该度量比现有方法更能预测下游性能并助于预训练检查点选择。
Comments 13 pages, 7 figures. ICML 2026 (Spotlight)
检测器在杂乱操作中检测的是物体存在而非遮挡
机构 * School of Computer Science & Informatics, Cardiff University(计算机科学与信息学院,卡迪夫大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 研究开放词汇检测器在物体被遮挡时的表现,通过与几何分割预言机配对审核其对遮挡的反映,发现其置信度与可见性无关,会误判,基于置信度的指标和门控有问题,还将效应与校准错误等联系起来并给出建议。
Comments 12 pages, 3 figure, 6 tables
用于交通管理的成本最优基础模型部署组合
机构 * Cornell University(康奈尔大学) ; University of California, Berkeley(加州大学伯克利分校) ; The Hong Kong Polytechnic University(香港理工大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI
AI总结 研究交通管理中基础模型部署组合问题,提出FMDP混合整数规划,证明其NP难,给出多项式时间贪婪启发式算法,通过案例研究确定低成本组合,经盈亏平衡分析得出本地GPU投资合理的条件。
Comments Accepted at IEEE ITSC 2026
不仅仅是你在哪里:从跨视图定位中学习语义、结构和几何
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Beijing Aerospace Control Center(北京航天飞行控制中心)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 研究如何在极端视角变化下通过跨视图定位让模型学习语义、结构和几何。提出CROSS框架,克服现有方法局限,经实验验证该框架在跨视图定位中性能最优,能有效学习多方面内容。
GEST引擎:从事件图到合成视频。完整技术报告
机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) ; National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) ; Büchi Labortechnik AG(布赫实验室技术公司)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 GEST引擎从自然语言文本生成多角色视频,核心是明确的世界模型,以GEST表示世界状态。通过程序或智能系统生成GEST,经四阶段管道执行,能输出多种视频相关数据,且保证相关特性,其输出可作视频理解多方面工具。
相同的故事,不同的旅程:从社交媒体比较到人工智能介导的同伴职业探索中的意义建构
机构 * Sun Yat-sen University(中山大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究针对年轻求职者在社交媒体职业探索时被动浏览的问题,开发JobMate交互式系统,将真实帖子转化为对话式AI代理,通过对比研究发现其能引导社会比较转向建设性自我重构并促进意义建构,还探讨了相关AI系统设计启示。
Comments 10 pages, 7 figures, 2 tables
Q学习实验室:通过学习者生成的轨迹分析教授强化学习
机构 * Computer Science Program Faculty of Sciences and Liberal Arts Rajamangala University of Technology Isan(计算机科学系 法学院及文科院 瑞亚玛芒拉大学技术学院伊桑)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 该研究提出Q学习实验室工具,通过学习者生成的轨迹分析教授表格Q学习。工具具可视化及记录功能,核心是学习-导出-分析循环。通过三项评估验证工具,还与现有工具比较、阐述教学法基础并提供教案,工具和代码公开。
Comments 12 pages, 5 figures
知识条件下的可执行Unity游戏场景单遍大语言模型合成:26个目标可玩概念的编译器错误普查
机构 * Chalmers University of Technology(查尔姆斯理工大学) ; University of Gothenburg(哥德堡大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 研究大语言模型为Unity游戏场景编写代码,去除迭代修复循环进行单遍生成评估,通过对多个模型、模式等生成的代码分析编译器错误,发现瓶颈是缺少引擎特定知识,按需求对目标模式排序展示单遍生成断点。
Comments Substantially reframed and extended version of arXiv:2603.07101, with new experiments, figures, and analysis
从模糊话语到受控重用类:规范化、商不变性和条件可判定性
机构 * Minerva CQ (Bourbaki Intelligent Systems, Inc.)(密涅瓦CQ(布尔巴基智能系统公司))
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究在受控领域改变语义缓存中答案重用对象,基于已解决对话需求的数学特征商。通过三个关系形成细化链,使管道输出不变,明确重用商,阐述支持层强度,包括多种特性及可计算性、可接受性等。
BatteryLake:基于物理原理的异构电池老化数据智能管理与基准测试
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 针对公共电池老化数据集应用受限问题,BatteryLake通过大语言模型智能体、人在回路机制等,将原始数据转化为可用于基准测试的资产,还发布了含多种任务和协议的开放基准测试。
Comments The platform, benchmark, and curation protocol are publicly available at https://tianwen1209.github.io/batterylake/
验证器即课程:用于跨家族游戏生成的执行门控自蒸馏
机构 * Institute of Science Tokyo(东京科学研究所) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究针对游戏生成中代码生成器的优化,提出执行门控自蒸馏方法,通过严格启动过滤器提升跨家族泛化能力,在GameCraft-Bench上实验表明该方法显著提高干净生成率和覆盖率,验证器对模型学习有重要作用。