arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-21 至 2025-08-21 共收录 1 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1 篇

2507.10016 2025-08-21 cs.CR cs.SD eess.AS 82%

The Man Behind the Sound: Demystifying Audio Private Attribute Profiling via Multimodal Large Language Model Agents

Lixu Wang, Kaixiang Yao, Xinfeng Li, Dong Yang, Haoyang Li, Xiaofeng Wang, Wei Dong

机构 * Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract)

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏