TAG: Thinking with Action Unit Grounding for Facial Expression Recognition
TAG:基于动作单元的面部表情识别中的思维
专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 TAG通过基于动作单元的视觉-语言框架,提升面部表情识别的推理可信度和视觉一致性。
Comments 33 pages, 8 figures
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
TAG:基于动作单元的面部表情识别中的思维
专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 TAG通过基于动作单元的视觉-语言框架,提升面部表情识别的推理可信度和视觉一致性。
Comments 33 pages, 8 figures
基于接地的思考:用于长视频理解的课程强化推理与视频接地
机构 * Tsinghua University(清华大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI
AI总结 Video-TwG通过课程强化框架和接地范式提升长视频理解,采用双阶段策略和TwG-GRPO算法优化推理与接地质量。
NovaPlan: 通过闭环视频语言规划实现零样本长周期操控
机构 * Robotics and AI Institute(机器人与人工智能研究所) ; Carnegie Mellon University(卡内基梅隆大学) ; Brown University(布朗大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 NovaPlan通过闭环视频语言规划实现零样本长周期操控,结合高层任务分解与底层物理执行,无需先验演示即可完成复杂装配任务。
Comments 25 pages, 15 figures. Project webpage: https://nova-plan.github.io/
LocateAnything3D: 基于视觉-语言的3D检测与链式视觉推理
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV
AI总结 LocateAnything3D通过将3D检测转化为下一个token预测问题,实现了多目标3D检测,取得了Omni3D基准测试中的最佳成绩。
Comments Tech report. Project page: https://nvlabs.github.io/LocateAnything3D/
安全且可解释的多模态路径规划用于多智能体协作
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI
AI总结 CaPE通过多模态路径规划实现安全且可解释的多智能体协作,利用视觉-语言模型和模型基于规划器确保路径调整的安全性和可解释性。
VIRTUE: 视觉-交互文本-图像通用嵌入器
机构 * Sony Group Corporation(索尼集团有限公司) ; Sony AI(索尼人工智能)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 VIRTUE通过引入视觉交互能力,提升图像和文本的联合表示学习,实现更精确的实体级信息处理和应用拓展。
Comments ICLR 2026. 25 pages. Project page: https://sony.github.io/virtue/
TextShield-R1: 用于篡改文本检测的强化推理
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 TextShield-R1通过强化学习和OCR校正技术,提升篡改文本检测的准确性和鲁棒性,解决现有方法在微特征识别和跨语言评估中的不足。
Comments AAAI 2026
EMAD: 基于证据的多模态诊断框架用于阿尔茨海默病
机构 * East China University of Science and Technology(东华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tencent(腾讯)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 EMAD通过多模态证据接地机制,生成结构化诊断报告,提升阿尔茨海默病诊断的透明度和临床一致性。
Comments Accepted by CVPR2026
GenesisGeo:技术报告
机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) ; Polytechnic Institute, Zhejiang University(浙江大学多科大学院) ; Hangzhou Research Institute of AI and Holographic Technology(杭州人工智能与全息技术研究 institutes) ; Volkswagen Group Innovation(大众集团创新) ; School of Mathematical Science, Zhejiang University(浙江大学数学科学学院)
专题命中 视觉定位与Grounding :visual language model(abstract);grounding(abstract);分类 cs.AI
AI总结 本文提出GenesisGeo-1M数据集及基于多任务学习的几何学习框架,通过大规模合成数据提升模型在几何推理任务中的性能,实现金牌级表现。
基于检索增强的增强双注意力框架的目标感知多模态孟加拉语仇恨表情识别
机构 * Department of Computer Science and Engineering, BRAC University(计算机科学与工程系,BRAC大学) ; Department of Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程系,Ahsanullah科技大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);LLaVA(abstract)
AI总结 本文提出基于检索增强的增强双注意力框架,用于目标感知多模态孟加拉语仇恨表情识别,通过语义对齐提升类别平衡和多样性,实验表明xDORA和RAG-Fused DORA在识别和检测任务中表现优异。
一种多模态框架,用于将人类语言描述与视觉感知数据对齐
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种多模态框架,通过结合语言和视觉信息,实现了对人类指称行为的稳健建模,并在经典认知基准上取得了优于人类的表现。
Comments 19 Pages, 6 figures, preprint
用于检索增强生成的神经符号检索器
机构 * Dept. of CSEE University of Maryland Baltimore County, Maryland, USA(电子工程系大学马里兰大学巴尔的摩县) ; Dept. of CSEE University of Maryland Baltimore County, MD, USA(电子工程系大学马里兰大学巴尔的摩县)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出神经符号 RAG 框架,通过结合知识图谱与神经检索技术,提升检索过程的透明性和生成性能。
Comments 8 pages, 2 Figures, Published in IEEE Intelligent Systems
CORE: 在博弈论压力下评估多智能体大语言模型交互质量
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 CORE通过量化多智能体LLM在不同博弈压力下的语言使用效果,揭示社会激励对语言适应的影响,并提供评估对话鲁棒性的指标。
Comments EACL 2026 (Main)
FOCA:基于多模态大语言模型的频率导向跨域伪造检测、定位与解释
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; DZ-Matrix ; Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室) ; Chongqing Research Institute of HIT(哈尔滨工业大学重庆研究院) ; University of New South Wales(新南威尔士大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 FOCA通过多模态大语言模型整合空间与频域特征,实现图像伪造的高精度检测、定位及可解释性解释,优于现有方法。
Rodent-Bench:用于评估多模态大语言模型在啮齿动物行为标注中的性能
机构 * University of Bristol(布里斯托大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 Rodent-Bench评估了多模态大语言模型在啮齿动物行为标注中的性能,发现现有模型存在时间分段、长视频处理和细微行为区分方面的挑战,为未来模型发展提供参考。
AgenticSum: 一种用于临床文本忠实总结的代理推理框架
机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) ; School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) ; University of Delaware, Newark, DE, USA(特拉华大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 AgenticSum通过代理推理框架提升临床文本摘要的准确性与一致性。
WildOS: 野外环境中的开放词汇物体搜索
机构 * Jet Propulsion Laboratory(喷气推进实验室) ; California Institute of Technology(加州理工学院) ; Swiss Federal Institute of Technology(瑞士联邦理工学院) ; ETH Zürich(苏黎世联邦理工学院) ; FieldAI Inc.(FieldAI公司) ; Stanford University(斯坦福大学) ; University of California Berkeley(加州大学伯克利分校)
专题命中 视觉定位与Grounding :visual reasoning(abstract);分类 cs.CV
AI总结 WildOS通过结合安全几何探索与语义视觉推理,实现野外环境中的开放词汇物体搜索,显著提升导航效率和自主性。
Comments 28 pages, 16 figures, 2 tables
RegionRoute: 区域风格迁移与扩散模型
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Dolby Laboratories, Inc.(杜比实验室)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 RegionRoute提出一种注意力监督的扩散框架,通过训练对齐风格标记的注意力分数与对象掩码,实现精确的区域风格迁移,提升风格应用的局部化能力。
高维程序化内容生成
机构 * McGill University(麦吉尔大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 高维程序化内容生成通过引入非几何游戏维度作为联合状态空间的一级坐标,提升可控性和表现力,实现更广泛的游戏机制生成。
跨域少样本目标检测中的多模态原型学习
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Zhejiang University(浙江大学) ; The University of Southern Queensland(昆士兰大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 本文提出LMP方法,通过结合文本和视觉信息,提升跨域少样本目标检测的精度和性能。
Comments Accepted to CVPR 2026 Findings
CM2:基于检查清单奖励的多轮多步代理工具使用的强化学习
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 CM2通过检查清单奖励提升多轮多步骤代理工具使用的强化学习效果,实现比监督微调更优的性能表现。
HeurekaBench: 一个用于AI合作者的基准评估框架
机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 HeurekaBench通过创建基于真实科学流程的基准,为评估AI合作者提供了一种方法,通过半自动流程生成探索性问题,并展示了批评模块对提升代理性能的效果。
Comments 33 pages, 5 figures, 7 tables. Code available at https://github.com/mlbio-epfl/HeurekaBench. Accepted to ICLR 2026
通过环境交互实现LLM代理的测试时适应
机构 * University of Waterloo(滑铁卢大学) ; Salesforce AI Research(Salesforce AI研究)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 通过环境交互实现LLM代理的测试时适应,利用语法对齐和动态接地策略提升代理在复杂环境中的泛化能力。
Comments Our code is available here: https://github.com/r2llab/GTTA
通过人工智能识别、解释和纠正歧视性语言
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本研究探讨了大型语言模型在纠正歧视性语言和促进包容性沟通中的潜力,并通过实验评估了AI与人类注释在效果和用户偏好上的差异。
Comments 17 pages, 6 figures, Accepted for publication in CHI'26, Barcelona, Spain, April 13 - 17, 2026; CHI '26: ACM CHI Conference on Human Factors in Computing Systems
ComUICoder:基于语义分割和元素反馈的组件式可重用UI代码生成用于复杂网站
专题命中 视觉定位与Grounding :multimodal large language model(abstract)
AI总结 ComUICoder通过语义分割和元素反馈技术,提升复杂网站中可重用UI代码的生成质量与重用性。
树的数量:一种基于树库的探索,研究语言中口语和写作中的句法变异
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出基于树库的方法,研究口语和写作中句法结构的差异,发现口语结构较少且多样性低,揭示了模态特定的句法偏好。
Comments Accepted manuscript. Published in Corpus Linguistics and Linguistic Theory (2026)
Journal ref Corpus Linguistics and Linguistic Theory, 2026. Advance online publication
TactEx:一种可解释的多模态机器人交互框架,用于类人触觉和硬度估计
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 TactEx通过融合视觉、触觉和语言模态,实现类人触觉和硬度估计,展示了在水果成熟度评估中的高任务成功率和可解释性。
Comments Accepted by 2026 ICRA