arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-30 至 2025-12-30 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2512.22218 2025-12-30 cs.CV cs.MM 79%

Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark

面向路牌的视觉问答:ViSignVQA数据集、方法与基准

Hieu Minh Nguyen, Tam Le-Thanh Dang, Kiet Van Nguyen

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(胡志明市信息技术大学) Vietnam National University(越南国家大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 ViSignVQA首次提出大规模越南语路牌多模态数据集,结合OCR与预训练语言模型,提升低资源语言VQA性能。

Comments Dataset paper; code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07984 2025-12-30 cs.CV 57%

View Selection for 3D Captioning via Diffusion Ranking

通过扩散排名进行3D描述生成的视图选择

Tiange Luo, Justin Johnson, Honglak Lee

机构 * University of Michigan LG AI Research(密歇根大学LG人工智能研究)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出DiffuRank方法,通过评估3D物体与2D视图的对齐度,提升3D描述生成的准确性与细节,同时扩展数据集规模并优于CLIP模型。

Comments Dataset link: https://huggingface.co/datasets/tiange/Cap3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22457 2025-12-30 cs.IR 50%

A Real-Time System to Populate FRA Form 57 from News

一种实时系统用于从新闻中填写FRA表单57

Chansong Lim, Haz Sameen Shahgir, Yue Dong, Jia Chen, Evangelos E. Papalexakis

专题命中 视觉问答 :vision language model(abstract)

AI总结 本文提出了一种实时系统,通过从新闻中提取信息来自动填写FRA表单57,解决了表单复杂性和新闻噪声问题。

Comments to be published in WSDM 2026 Demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏