arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-06 至 2026-01-06 共收录 67 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 12 篇

2510.17681 2026-01-06 cs.CV cs.AI 62%

PICABench: How Far Are We from Physically Realistic Image Editing?

PICABench: 我们距离物理真实图像编辑还有多远?

Yuandong Pu, Le Zhuo, Songhao Han, Jinbo Xing, Kaiwen Zhu, Shuo Cao, Bin Fu, Si Liu, Hongsheng Li, Yu Qiao, Wenlong Zhang, Xi Chen, Yihao Liu

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 PICABench通过系统评估物理真实感,探索图像编辑中物理效应的挑战与解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01915 2026-01-06 cs.CV 57%

TalkPhoto: A Versatile Training-Free Conversational Assistant for Intelligent Image Editing

TalkPhoto: 一种多功能的无需训练的对话式智能图像编辑助手

Yujie Hu, Zecheng Tang, Xu Jiang, Weiqi Li, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 TalkPhoto通过对话交互实现无需训练的多功能图像编辑,利用提示模板分层调用现有高级编辑方法,提升编辑精度与质量。

Comments a Conversational Assistant for Intelligent Image Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01870 2026-01-06 cs.CV 57%

Entity-Guided Multi-Task Learning for Infrared and Visible Image Fusion

实体引导的多任务学习用于红外和可见图像融合

Wenyu Shao, Hongbo Liu, Yunchuan Ma, Ruili Wang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 EGMT通过实体引导的多任务学习方法,提升红外和可见图像融合的语义一致性与质量。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21170 2026-01-06 cs.CL 50%

Cosmos: Compressed and Smooth Latent Space for Text Diffusion Modeling

Cosmos: 用于文本扩散建模的压缩和平滑潜在空间

Viacheslav Meshchaninov, Egor Chimbulatov, Alexander Shabalin, Aleksandr Abramov, Dmitry Vetrov

机构 * HSE University(俄罗斯高等经济大学) Constructor University(建设大学) SaluteDevices

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 Cosmos通过压缩和平滑的潜在空间提升文本生成效率,实现比传统方法更快的推理速度和相当的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 3 篇

2508.06372 2026-01-06 cs.SD cs.AI 79%

SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models

SpeakerLM:基于多模态大语言模型的端到端多功能说话人辨识与识别

Han Yin, Yafeng Chen, Chong Deng, Luyao Cheng, Hui Wang, Chao-Hong Tan, Qian Chen, Wen Wang, Xiangang Li

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.AI

AI总结 SpeakerLM通过多模态大语言模型实现端到端的说话人辨识与识别,结合灵活的说话人注册机制,提升多说话人场景下的识别性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02201 2026-01-06 cs.LG cs.CV 62%

CORE: Code-based Inverse Self-Training Framework with Graph Expansion for Virtual Agents

CORE: 基于代码的逆向自训练框架与图扩展用于虚拟代理

Keyu Wang, Bingchen Miao, Wendong Bu, Yu Wu, Juncheng Li, Shengyu Zhang, Wenqiao Zhang, Siliang Tang, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Wuhan University(武汉大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 CORE提出一种基于代码的逆向自训练框架,通过语义代码抽象和策略图扩展,提升虚拟代理的行为多样性和泛化能力。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01366 2026-01-06 cs.AI 57%

KGCE: Knowledge-Augmented Dual-Graph Evaluator for Cross-Platform Educational Agent Benchmarking with Multimodal Language Models

KGCE:基于多模态语言模型的跨平台教育代理基准评估知识增强双图评估器

Zixian Liu, Sihao Liu, Yuqi Zhao

机构 * Faculty of the School of Computer Science, Central China Normal University(中央财经大学计算机学院)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 KGCE提出一种基于多模态语言模型的跨平台教育代理基准评估框架,通过知识库增强和双图评估方法提升对特定学校软件任务的执行效率和评估精度。

详情

展开后加载摘要…

URL PDF HTML 收藏