arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-02 至 2026-03-02 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2602.23980 2026-03-02 cs.CV 79%

Venus: Benchmarking and Empowering Multimodal Large Language Models for Aesthetic Guidance and Cropping

Venus: 多模态大语言模型在审美指导与裁剪中的基准测试与赋能

Tianxiang Du, Hulingxiao He, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究所)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

AI总结 Venus通过两阶段框架提升多模态大语言模型的审美指导与裁剪能力,实现可解释的审美优化。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18969 2026-03-02 cs.NE 78%

Increasing Computation Resolves Conflicts in Vision Language Models

提升计算能力缓解视觉语言模型中的冲突

Bingyang Wang, Yijiang Li, Yitong Qiao, Maijunxian Wang, Tianwei Zhao, Yucheng Sun, Binyue Deng, Hokin Deng, Nuno Vasconcelos, Dezhi Luo

专题命中 其他VLM :vision language model(title,abstract)

AI总结 本研究发现视觉语言模型通过增加计算资源能更有效解决冲突,展示了大规模神经网络中的优化动态如何产生类人认知控制。

详情

展开后加载摘要…

URL PDF HTML 收藏