arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-11 至 2026-02-11 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2602.09531 2026-02-11 cs.CV 57%

DR.Experts: Differential Refinement of Distortion-Aware Experts for Blind Image Quality Assessment

DR.Experts: 基于失真感知专家的差分细化方法用于盲图像质量评估

Bohan Fu, Guanyi Qin, Fazhan Zhang, Zihao Huang, Mingxuan Li, Runze Hu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 DR.Experts通过引入失真感知专家和差分细化方法,有效整合失真先验知识,提升盲图像质量评估的准确性与泛化能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09521 2026-02-11 cs.CV 57%

Attention to details, logits to truth: visual-aware attention and logits enhancement to mitigate hallucinations in LVLMs

关注细节,logits到真相:视觉感知注意力与logits增强以减轻LVLMs中的幻觉

Jingyi Wang, Fei Li, Rujie Liu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的注意力干预算法,通过增强任务相关token的注意力和改进解码过程,有效减少LVLMs中的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏