arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-08-05 至 2026-08-05 共收录 4
2608.02907 2026-08-05 cs.LG 新提交

Bayesian Data Reweighting Improves Multimodal Retrieval for Knowledge-Based Visual Question Answering

贝叶斯数据重加权改进基于知识的视觉问答的多模态检索

Jingchen Sun, Shaobo Han, Ruiyi Zhang, Naresh Kumar Devulapally, Ming Liu, Yitao Long, Vishnu Suresh Lokhande, Changyou Chen

机构 * University at Buffalo(布法罗大学) NEC Laboratories America(美国 NEC 实验室) Adobe Research(奥多比研究院) Iowa State University(爱荷华州立大学) New York University(纽约大学)

AI总结 针对基于知识的视觉问答中多模态检索的负样本处理问题,提出贝叶斯数据重加权框架,通过概率建模与随机EM优化,在三个检索器和七个基准上提升了检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02604 2026-08-05 cs.AI cs.IR 新提交

ISEE: Interactive Semantic Enrichment for Database Fields

ISEE:数据库字段的交互式语义丰富

Yuan Tian, Yiru Chen, Rakesh R. Menon, Zifan Liu, Ting Cai, Fei Wu, Anudeep Chimakurthi, Prashanthi Ramamurthy, Sridevi Aishwariya Ganesan, Kun Qian, Yunyao Li

机构 * Purdue University(普渡大学) Adobe(奥多比公司)

AI总结 该研究提出ISEE系统,通过评分、收集领域知识并与用户协作丰富数据库字段语义,可降低认知负荷、提升描述质量并增强下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27670 2026-08-05 cs.CV cs.AI 版本更新

JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles

JigShape:通过拼图任务评估视觉语言模型的视觉几何推理能力

Shawn Li, Wei Yang, Jike Zhong, Jiate Li, Jiawei Yang, You Qin, Ryan Rossi, Franck Dernoncourt, Roger Zimmermann, Yue Wang, Zhengzhong Tu, Vicente Ordonez, Mohit Bansal, Yue Zhao

机构 * University of Southern California(南加州大学) National University of Singapore(新加坡国立大学) Adobe Research(奥多比研究院) Texas A&M University(德克萨斯农工大学) Rice University(莱斯大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本研究提出JigShape拼图基准,发现零样本VLM大多缺乏几何推理能力,所有模型在大尺寸拼图上均出现性能崩塌,将可扩展几何推理确立为VLM的开放性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01774 2026-08-05 cs.LG cs.AI 版本更新

FLARE: Diffusion for Hybrid Language Model

FLARE: 混合语言模型的扩散方法

Yuchen Zhu, Jing Shi, Chongjian Ge, Hao Tan, Yiran Xu, Wanrong Zhu, Jason Kuen, Koustava Goswami, Rajiv Jain, Yongxin Chen, Molei Tao, Jiuxiang Gu

机构 * Adobe Research(Adobe研究院) Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出FLARE框架,通过结合自回归和扩散目标、硬件感知内核和统一推理,将混合注意力LLM转换为支持并行解码的扩散模型,在保持能力的同时提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏