Wyvern: An Agentic Framework for Generating Grounded Multimodal Reports
Wyvern:用于生成基于事实的多模态报告的智能体框架
机构 * Politecnico di Torino(都灵理工大学) ; Huawei Research(华为研究院)
AI总结 针对生成式模型内容缺乏事实依据的问题,提出Wyvern多智能体框架生成多模态技术报告,经评估其图像信息量、报告实用性及引用指标均优于基准方法。
大厂专区
Wyvern:用于生成基于事实的多模态报告的智能体框架
机构 * Politecnico di Torino(都灵理工大学) ; Huawei Research(华为研究院)
AI总结 针对生成式模型内容缺乏事实依据的问题,提出Wyvern多智能体框架生成多模态技术报告,经评估其图像信息量、报告实用性及引用指标均优于基准方法。
InfiniVerse: 面向自动驾驶的占用引导无界场景生成
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Nanyang Technological University(南洋理工大学) ; Huawei Technologies Ltd.(华为技术有限公司) ; University of New South Wales(新南威尔士大学)
AI总结 提出InfiniVerse统一框架,通过3D占用表示和视频扩散模型实现从单帧到长距离、2D-3D对齐的动态城市场景可控生成,在Waymo和nuScenes上达到SOTA。
Comments Paper accepted as poster at ECCV workshop SPAD
全局-局部双感知用于高分辨率文本密集图像翻译的MLLMs
机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Labs, Huawei Technologies Co., LTD(华为技术有限公司2012实验室) ; School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)
AI总结 本文提出GLoTran框架,通过全局-局部双感知方法提升高分辨率文本密集图像翻译的准确性和完整性。