arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-18 至 2025-12-18 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7 篇

2512.15115 2025-12-18 cs.LG cs.AI 62%

How Many Heads Make an SSM? A Unified Framework for Attention and State Space Models

多少个头才能构成一个SSM?一种统一的注意力和状态空间模型框架

Ali Ghodsi

机构 * Ali Ghodsi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种统一框架,通过输入依赖的有效交互操作符,分析了注意力和状态空间模型的表达性和可训练性权衡,并推导了三个理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14989 2025-12-18 cs.CL cs.AI cs.CV 62%

Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams

评估大型语言模型在多模态化学奥林匹克考试中的表现

Yiming Cui, Xin Yao, Yuxuan Qin, Xin Li, Shijin Wang, Guoping Hu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) iFLYTEK AI Research(iFLYTEK人工智能研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文评估了多种多模态LLM在化学奥林匹克考试中的表现,发现其在多模态融合和科学推理方面存在显著局限,提出通过链式思维提示提升模型性能的方法。

Comments Published at Communications Chemistry

Journal ref Commun. Chem. 8 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14938 2025-12-18 cs.CV cs.AI cs.MM cs.SD 62%

TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation

TalkVerse:民主化分钟级音频驱动视频生成

Zhenzhi Wang, Jian Wang, Ke Ma, Dahua Lin, Bing Zhou

机构 * The Chinese University of Hong Kong(香港中文大学) Snap Inc.(Snap公司)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 TalkVerse通过大规模开放数据和高效模型,实现了分钟级音频驱动视频生成,降低研究门槛,提升生成质量与效率。

Comments open-sourced single-person full-body talking video generation dataset, training code and checkpoints

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10402 2025-12-18 cs.LG cs.AI 62%

The Eminence in Shadow: Exploiting Feature Boundary Ambiguity for Robust Backdoor Attacks

阴影中的卓越:利用特征边界模糊性实现稳健的后门攻击

Zhou Feng, Jiahao Chen, Chunyi Zhou, Yuwen Pu, Tianyu Du, Jinbao Li, Jianhai Chen, Shouling Ji

机构 * Zhejiang University(浙江大学) Chongqing University(重庆大学) Qilu University of Technology (Shandong Academy of Science)(青岛科技大学(山东科学院))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 Eminence通过利用特征边界模糊性,实现稳健且隐蔽的后门攻击,以极低的毒化率有效提升攻击效果。

Comments Accepted by KDD2026 Cycle 1 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15310 2025-12-18 cs.CV 57%

SynthSeg-Agents: Multi-Agent Synthetic Data Generation for Zero-Shot Weakly Supervised Semantic Segmentation

SynthSeg-Agents: 多智能体合成数据生成用于零样本弱监督语义分割

Wangyu Wu, Zhenhong Chen, Xiaowei Huang, Fei Ma, Jimin Xiao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学) Microsoft(微软公司)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 SynthSeg-Agents利用大型语言模型生成合成数据,无需现实图像即可实现零样本弱监督语义分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06032 2025-12-18 cs.CV 57%

Learning 3D Texture-Aware Representations for Parsing Diverse Human Clothing and Body Parts

学习3D纹理感知表示以解析多样化的人类服装和身体部位

Kiran Chhatre, Christopher Peters, Srikrishna Karanam

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 Spectrum通过改进的3D纹理生成模型,实现了对多样化人类服装和身体部位的精细解析与分割。

Comments Association for the Advancement of Artificial Intelligence (AAAI) 2026, 14 pages, 11 figures. Webpage: https://s-pectrum.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03197 2025-12-18 cs.CL 50%

Explain with Visual Keypoints Like a Real Mentor! A Benchmark for Multimodal Solution Explanation

像真实导师一样用视觉关键点解释吧!一个多模态解决方案解释基准

Jaewoo Park, Jungyang Park, Dongju Jang, Jiwan Chung, Byungwoo Yoo, Jaewoo Shin, Seonjoon Park, Taehyeong Kim, Youngjae Yu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出多模态解决方案解释任务和ME2数据集,旨在评估模型识别视觉关键点并生成相关解释的能力,揭示当前LLM在数学视觉推理和教育应用中的不足。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏