KARLA: Knowledge-base Augmented Retrieval for Language Models
KARLA:基于知识库增强的语言模型检索
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出一种新方法,使LLM在生成过程中自动从知识库提取事实知识,支持知识更新、可追溯性和小模型的高事实准确性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
KARLA:基于知识库增强的语言模型检索
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出一种新方法,使LLM在生成过程中自动从知识库提取事实知识,支持知识更新、可追溯性和小模型的高事实准确性。
PressMimic: 压力引导的动作捕捉与控制用于人形机器人模仿
机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) ; Key Laboratory of Optoelectronic Devices and Systems with Extreme Performances of MOE, Nanjing University(南京大学极端性能光电技术与系统教育部重点实验室) ; BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 提出PressMimic框架,通过压力模态融合RGB估计3D姿态和全局运动,并利用压力监督策略实现物理一致的接触模式,提升人形机器人模仿的准确性和稳定性。
MKG-RAG-Bench:多模态知识图谱增强生成中的检索基准
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Michigan State University(密歇根州立大学) ; Dalian University of Technology(大连理工大学) ; Stony Brook University(石溪大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出MKG-RAG-Bench基准,通过构建跨领域多模态知识图谱和问答数据集,系统评估多模态知识图谱增强生成中的检索性能,揭示检索质量对生成结果的决定性作用。
Comments Accepted by KDD'26
ConflictScore: 识别和衡量语言模型如何处理冲突证据
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出ConflictScore指标,通过将回答分解为原子声明并与证据文档对比,量化模型对冲突证据的识别程度,实验表明该指标能有效检测过度自信声明并提升真实性。
GRAG:面向个性化对话系统的通用响应增强生成框架
机构 * North Carolina State University(北卡罗来纳州立大学) ; Lirio, Inc.(Lirio公司)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 提出GRAG框架,通过离线通用响应解耦内容基础与个性化,使小模型在资源受限环境中专注于个性化注入,性能提升显著。
VistaRef: 提升指向目标检测的视觉空间方位感知能力
机构 * Tsinghua University(清华大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; Dalian University of Technology(大连理工大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 提出VistaRef框架,通过局部手部实体建模和几何射线建模模块增强空间方位感知,并引入方向一致性对齐损失,在指向目标检测任务中实现14个绝对点的精度提升。
通过几何感知蒸馏提升文本驱动视频分割
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 提出GeoLaV两阶段框架,通过单目几何预训练和几何感知蒸馏,将3D几何知识从图像迁移到视频,提升文本驱动视频分割的时空一致性和语言定位能力,在多个基准上达到最优。
Comments Accepted by ECCV2026
形式验证证书的循环一致性神经解释
机构 * J.P. Morgan AI Research(摩根大通人工智能研究院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出循环一致性神经架构,通过前向和逆向网络结合符号验证器,生成忠实于形式验证证书的自然语言解释,在金融合规领域测试中达到90.0%的循环验证正确性,比多LLM基线高13.9个百分点。
Comments 15 pages of main text
UniTranslator:一种用于端到端图像内机器翻译的统一多模态框架
机构 * MiLM Plus, Xiaomi Inc(小米公司MiLM Plus) ; Binghamton University(宾汉姆顿大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 提出UniTranslator统一框架,通过理解-生成对齐模块和空间掩码解码器解决翻译理解与文本编辑的冲突及空间错位问题,在多个基准上实现最先进性能。
Comments Accepted by ECCV 2026
LLM归因指标是否可迁移?跨数据集和构念的检索增强生成评估审计
机构 * Amazon Web Services(亚马逊云服务)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 本研究审计了八种自动归因评分器在三个评估构念上的表现,发现没有评分器能在所有数据集上保持最佳性能,指标排名会反转,且简单选择最佳平均评分器会导致显著遗憾。
分布漂移下的目标感知线性回归
机构 * Department of Statistics(统计学系) ; Columbia University(哥伦比亚大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 针对训练与部署间的分布漂移,提出混合损失估计器作为目标感知基准,并开发了约束矩匹配和两阶段估计两种计算可行方案,推导渐近均方误差并比较性能。
通过元学习进行选择性时间序列预测
机构 * Faculdade de Engenharia da Universidade do Porto(波尔图大学工程学院) ; University of Coimbra(科英布拉大学) ; Fraunhofer Portugal AICOS(弗劳恩霍夫葡萄牙AICOS)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 提出基于元学习的框架,利用滞后结构特征建模误差百分位数,实现跨域选择性预测,在域内和迁移学习中提升预测精度。
Comments 16 pages, 5 figures
BoxCtrl: 面向几何图像编辑的3D感知视觉提示
机构 * City University of Hong Kong(香港城市大学) ; Tencent(腾讯)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV
AI总结 提出BoxCtrl框架,通过投影到2D的RGB 3D边界框作为视觉提示,结合监督微调与强化学习两阶段训练,实现精确的3D几何编辑(平移、旋转、缩放等),达到最先进性能。
Comments Accepted by SIGGRAPH 2026
当AUC 0.998还不够:多模态计算机使用智能体中隐藏状态探针对间接提示注入的候选评估协议
机构 * Northeastern University(东北大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Southern Methodist University(南卫理公会大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.LG
AI总结 本文通过单骨干案例研究,论证高AUC不能直接证明恶意内容检测,提出后验诊断和候选控制集来明确探针能力的边界。
Comments 17 pages, 3 figures. Camera-ready version for EvalMG '26, The 2nd Workshop on Evaluation for Multimodal Generation, co-located with SIGIR 2026
4DVLT:以世界线为中心的视觉-语言跟踪动态场景理解
机构 * Huazhong University of Science and Technology(华中科技大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 提出世界线为中心的4D动态场景理解任务4DVLT及基准Instruct-4D,通过图条件世界线推理方法4DTrack实现指令跟踪,在指标上超越基线19.62点。
词汇共识:人工智能体中的具身词汇学习与共享意义
机构 * Neurocreaciones
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出词汇共识框架,利用冻结的DINOv2视觉嵌入和卡罗尔式无意义词,研究智能体如何从结构化感知中获取、稳定和使用新词汇意义,发现感知距离主导词汇习得梯度。
Comments 41 pages, 12 figures, 9 tables. Code and experiment artifacts available at https://github.com/patriciomvera/lexical-consensus
当AI说“我也有过类似经历”:同伴式照护支持中的合成生活经验
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 研究AI在同伴支持中生成“合成生活经验”的悖论,通过分析人类与AI在阿尔茨海默病照护社区中的叙事差异,揭示AI虽能模拟情感支持但缺乏真实经历,需建立机制区分支持性语言与虚构经历。
MuVAP: 面向野外对话轮次预测的多模态多方语音活动投影
机构 * Department of Speech Music and Hearing, KTH Stockholm, Sweden(瑞典皇家理工学院言语、音乐与听觉系)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出MuVAP框架,通过将声学预测锚定到面部轨迹,实现从单声道音频和单摄像头视角进行说话人感知的轮次预测,并引入角色相对投影和AVCC数据集解决多方建模和因果跟踪问题。
电路同步先于泛化:来自Grokking Transformer中傅里叶结构的因果证据
机构 * New York University(纽约大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 提出频率同步度(FSD)指标,发现其在模算术任务中比grokking早500-3000步同步,且通过权重衰减控制验证了间隔期的正则化本质,提供因果证据。
Comments 19 pages, 9 figures, 11 tables. v2: corrected scaling-law to report error bars across seeds (R^2 0.89-0.99) rather than single-draw fits; added non-abelian (S5) transfer experiment; revised title
Lagrange: 一种面向通用端到端驾驶的开放词汇、基于能量的稀疏框架
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI
AI总结 提出Lagrange框架,利用掩码潜在场和视觉语言模型实现开放词汇、稀疏计算,通过拉格朗日动作最小化确保运动学约束,在nuScenes和CODA基准上验证了鲁棒性和可解释性。
ScaffoldAgent: 面向开放式深度研究的效用引导动态大纲优化
机构 * National Engineering Research Center of Software Engineering, Peking University(北京大学软件工程国家工程研究中心) ; School of Computer Science, Peking University(北京大学计算机学院) ; Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) ; GRG Banking Equipment Co., Ltd.(广电运通金融电子股份有限公司) ; Center on Frontiers of Computing Studies, Peking University(北京大学计算前沿研究中心) ; Peking University Information Technology Institute (Tianjin Binhai)(北京大学(天津滨海)信息技术研究院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出ScaffoldAgent框架,通过效用引导的动态大纲优化(扩展、收缩、修订操作)解决开放式深度研究中大纲漂移问题,在DeepResearch Bench和Gym上提升长报告生成与事实准确性。
Comments 9 pages, 6 figures
均值分位数:一种用于最小最大最优强化学习的无奖励集成方法
机构 * Google Research(谷歌研究院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 提出一种基于分位数的集成方法,无需计数即可在有限时域MDP中实现最优方差依赖的遗憾界,为强化学习中的集成探索提供理论依据。
代理式电子设计自动化:一种交接视角
机构 * The Chinese University of Hong Kong(香港中文大学) ; Primarius Technologies(Primarius技术公司)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文从交接有效性角度出发,将EDA流程中的代理系统分为三类,并提出五层代理通信协议,以解决多阶段、多工具间的状态传递和验证问题。
NEST:面向长视频理解的时间叙事事件结构
机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 提出NEST数据集(1005部全长电影),通过多模态叙事事件标注和关系链接,评估模型在长视频中理解事件结构、时间顺序和长程依赖的能力,实验表明事件检测等任务极具挑战性。
可信多智能体系统:使用Argent信令协议缓解语义漂移
机构 * Synechron Inc(Synechron公司)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出Argent信令协议(ASP),通过结构化质量信号区分可修复与不可修复的失败,在文档问答和多智能体系统中分别提升通过率和阻断无依据传播。
Comments 17 pages
DRFLOW:用于个性化工作流预测的深度研究基准
机构 * ServiceNow AI Research(ServiceNow人工智能研究)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出DRFLOW基准,评估AI代理从异构源预测个性化工作流的能力,包含5领域100任务,并设计7个诊断指标,实验显示现有代理性能有限。
PepALD: 通过自回归潜在扩散生成大环肽
机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) ; School of Mathematics, Sichuan University(四川大学数学学院) ; School of Artificial Intelligence, Sichuan University(四川大学人工智能学院) ; Lingang Laboratory(临港实验室)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 提出PepALD模型,结合自回归潜在扩散与化学嵌入,实现从头设计大环肽,并利用偏好优化提升亲和力,在生成质量和奖励优化上优于基线。
Comments 18 pages, 5 figures, 3 tables
X+Slides:面向受众条件的幻灯片生成基准测试
机构 * Shanghai Jiao Tong University(上海交通大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; SenseTime
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出X+Slides基准,通过动态评估框架和受众特定权重,衡量幻灯片生成系统在受众覆盖、领域覆盖、效率和正确性方面的表现,揭示现有系统在受众关键信息恢复上的不足。
ThinkDeception: 一种用于可解释多模态欺骗检测的渐进式强化学习框架
机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI
AI总结 提出ThinkDeception框架,将多模态大语言模型引入欺骗检测,通过逐步推理和视觉-音频一致性组相对策略优化(VAC-GRPO)实现可解释的认知推理,在主流基准上达到新SOTA。
Comments 10pages,4figures
SAERec:通过稀疏自编码器为推荐构建细粒度可解释意图先验
机构 * University of Georgia(佐治亚大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Education University of Hong Kong(香港教育大学) ; Jilin University(吉林大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出SAERec模型,利用稀疏自编码器从大型语言模型文本嵌入中解耦出细粒度可解释意图,作为先验指导推荐,并通过多分支注意力机制融合个人与公共意图,提升推荐性能与可解释性。