arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-19 至 2025-12-19 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 11 篇

2512.15949 2025-12-19 cs.CV 83%

The Perceptual Observatory Characterizing Robustness and Grounding in MLLMs

感知观测站:多模态大语言模型的鲁棒性与基础性表征

Tejas Anvekar, Fenil Bardoliya, Pavan K. Turaga, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 感知观测站通过系统性扰动和真实数据集,评估多模态大语言模型在视觉基础性和关系结构上的鲁棒性,揭示其在扰动下的表现,为模型分析提供系统基础。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16770 2025-12-19 cs.CL cs.AI 79%

GinSign: Grounding Natural Language Into System Signatures for Temporal Logic Translation

GinSign:将自然语言接地到系统签名以进行时序逻辑翻译

William English, Chase Walker, Dominic Simon, Rickard Ewetz

机构 * University of Florida(佛罗里达大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 GinSign通过将自然语言接地到系统签名,提升时序逻辑翻译的准确性和下游模型检查能力,实现95.5%的逻辑等价分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15971 2025-12-19 cs.CV 77%

From Words to Wavelengths: VLMs for Few-Shot Multispectral Object Detection

从词语到波长:用于少样本多光谱目标检测的视觉语言模型

Manuel Nkegoum, Minh-Tan Pham, Élisa Fromont, Bruno Avignon, Sébastien Lefèvre

机构 * Univ Bretagne Sud, IRISA, UMR 6074(布列塔尼大学,IRISA,UMR 6074) Univ Rennes, IRISA, UMR 6074(里尔大学,IRISA,UMR 6074) ATERMES UiT The Arctic University of Norway(北欧大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出利用视觉语言模型进行少样本多光谱目标检测,通过整合文本、视觉和热模态,在数据稀缺情况下实现高效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12793 2025-12-19 cs.RO 67%

VLG-Loc: Vision-Language Global Localization from Labeled Footprint Maps

VLG-Loc: 从标注足迹地图实现视觉-语言全局定位

Mizuho Aoki, Kohei Honda, Yasuhiro Yoshimura, Takeshi Ishita, Ryo Yonetani

机构 * The Department of Mechanical Systems Engineering, Nagoya University(名古屋大学机械系统工程系) CyberAgent AI Lab(CyberAgent AI实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 VLG-Loc通过视觉-语言模型实现从标注足迹地图的全局定位,结合蒙特卡洛定位框架和概率融合提升环境变化下的鲁棒性。

Comments v2: Updated the citation of SparseLoc from an arXiv preprint to its published version in the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16924 2025-12-19 cs.CV 57%

The World is Your Canvas: Painting Promptable Events with Reference Images, Trajectories, and Text

世界是你的画布:通过参考图像、轨迹和文本绘画可提示事件

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Yue Yu, Yihao Meng, Wen Wang, Ka Leong Cheng, Shuailei Ma, Qingyan Bai, Yixuan Li, Cheng Chen, Yanhong Zeng, Xing Zhu, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) ZJU(浙江大学) NEU(南京大学) CUHK(香港中文大学) NTU(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 WorldCanvas通过结合文本、轨迹和参考图像,实现可提示的多代理交互事件生成,提升世界模型的交互性和可控性。

Comments Project page and code: https://worldcanvas.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16841 2025-12-19 cs.CV 57%

Radiology Report Generation with Layer-Wise Anatomical Attention

基于层间解剖注意力的放射报告生成

Emmanuel D. Muñiz-De-León, Jorge A. Rosales-de-Golferichs, Ana S. Muñoz-Rodríguez, Alejandro I. Trejo-Castro, Eduardo de Avila-Armenta, Antonio Martínez-Torteya

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出了一种基于层间解剖注意力的紧凑图像到文本模型,用于生成胸部X光报告的发现部分,通过整合解剖区域信息提升了报告的准确性和连贯性。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16444 2025-12-19 cs.AI 57%

StarCraft+: Benchmarking Multi-agent Algorithms in Adversary Paradigm

StarCraft+: 在对抗范式下评估多智能体算法的基准测试

Yadong Li, Tong Zhang, Bo Huang, Zhen Cui

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学) School of Information Science and Engineering, Zaozhuang University(信息科学与工程学院,枣庄大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出SC2BA环境,通过对抗范式评估多智能体算法,揭示算法在有效性、灵敏度和可扩展性方面的挑战。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16077 2025-12-19 cs.CV 57%

Auto-Vocabulary 3D Object Detection

自动词汇3D目标检测

Haomeng Zhang, Kuan-Chuan Peng, Suhas Lohit, Raymond A. Yeh

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室(MERL))

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 AV3DOD通过自动生成类别名称,实现了无需用户输入的开放词汇3D目标检测,取得SOTA性能。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03508 2025-12-19 cs.CV 57%

Exploiting Domain Properties in Language-Driven Domain Generalization for Semantic Segmentation

利用领域特性进行语言驱动的领域泛化以实现语义分割

Seogkyu Jeon, Kibeom Hong, Hyeran Byun

机构 * Yonsei University(延世大学) Sookmyung Women’s University(淑明女子大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出DPMFormer框架,通过领域感知提示学习和对比学习提升语义分割的领域泛化能力。

Comments ICCV 2025 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00774 2025-12-19 q-bio.BM cs.LG 57%

GeoGraph: Geometric and Graph-based Ensemble Descriptors for Intrinsically Disordered Proteins

GeoGraph: 基于几何和图的集成描述符用于内在无序蛋白质

Eoin Quinn, Marco Carobene, Jean Quentin, Sebastien Boyer, Miguel Arbesú, Oliver Bent

机构 * InstaDeep

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 GeoGraph通过结合几何和图方法,从序列预测内在无序蛋白质的构象集合统计信息,提升对关键生物物理性质的预测能力。

Comments Accepted at AI4Science and ML4PS NeurIPS Workshops 2025. v2: comparison with Human-IDRome model and link to github added

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00877 2025-12-19 eess.SY cs.CL cs.SY 50%

Verifiable Natural Language to Linear Temporal Logic Translation: A Benchmark Dataset and Evaluation Suite

可验证的自然语言到线性时序逻辑翻译:一个基准数据集和评估套件

William H English, Chase Walker, Dominic Simon, Sumit Kumar Jha, Rickard Ewetz

机构 * University of Florida(佛罗里达大学) Florida International University(佛罗里达国际大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出VLTL-Bench,一个用于评估可验证自然语言到线性时序逻辑翻译的基准数据集和评估套件。

详情

展开后加载摘要…

URL PDF HTML 收藏