PICABench: How Far Are We from Physically Realistic Image Editing?
PICABench: 我们距离物理真实图像编辑还有多远?
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI
AI总结 PICABench通过系统评估物理真实感,探索图像编辑中物理效应的挑战与解决方案。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
PICABench: 我们距离物理真实图像编辑还有多远?
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI
AI总结 PICABench通过系统评估物理真实感,探索图像编辑中物理效应的挑战与解决方案。
TalkPhoto: 一种多功能的无需训练的对话式智能图像编辑助手
机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 TalkPhoto通过对话交互实现无需训练的多功能图像编辑,利用提示模板分层调用现有高级编辑方法,提升编辑精度与质量。
Comments a Conversational Assistant for Intelligent Image Editing
实体引导的多任务学习用于红外和可见图像融合
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 EGMT通过实体引导的多任务学习方法,提升红外和可见图像融合的语义一致性与质量。
Comments Accepted by IEEE Transactions on Multimedia
Cosmos: 用于文本扩散建模的压缩和平滑潜在空间
机构 * HSE University(俄罗斯高等经济大学) ; Constructor University(建设大学) ; SaluteDevices
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 Cosmos通过压缩和平滑的潜在空间提升文本生成效率,实现比传统方法更快的推理速度和相当的生成质量。
SpeakerLM:基于多模态大语言模型的端到端多功能说话人辨识与识别
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.AI
AI总结 SpeakerLM通过多模态大语言模型实现端到端的说话人辨识与识别,结合灵活的说话人注册机制,提升多说话人场景下的识别性能。
Comments Accepted by AAAI 2026
CORE: 基于代码的逆向自训练框架与图扩展用于虚拟代理
机构 * Zhejiang University(浙江大学) ; Wuhan University(武汉大学)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 CORE提出一种基于代码的逆向自训练框架,通过语义代码抽象和策略图扩展,提升虚拟代理的行为多样性和泛化能力。
Comments 19 pages, 12 figures
KGCE:基于多模态语言模型的跨平台教育代理基准评估知识增强双图评估器
机构 * Faculty of the School of Computer Science, Central China Normal University(中央财经大学计算机学院)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI
AI总结 KGCE提出一种基于多模态语言模型的跨平台教育代理基准评估框架,通过知识库增强和双图评估方法提升对特定学校软件任务的执行效率和评估精度。