arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2025-11-21 至 2025-11-21 共收录 4
2511.16666 2025-11-21 cs.CV

SceneDesigner: Controllable Multi-Object Image Generation with 9-DoF Pose Manipulation

SceneDesigner: 9自由度姿态操控的可控多物体图像生成

Zhenyuan Qin, Xincheng Shuai, Henghui Ding

机构 * Fudan University(复旦大学)

AI总结 SceneDesigner通过9自由度姿态操控实现多物体图像生成,采用CNOCS图和两阶段训练策略提升可控性与质量。

Comments NeurIPS 2025 (Spotlight), Project Page: https://henghuiding.com/SceneDesigner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16602 2025-11-21 cs.AI

Bridging VLMs and Embodied Intelligence with Deliberate Practice Policy Optimization

通过刻意练习策略优化弥合视觉语言模型与具身智能之间的鸿沟

Yi Zhang, Che Liu, Xiancong Ren, Hanchu Ni, Yingji Zhang, Shuai Zhang, Zeyuan Ding, Jiayu Hu, Haozhe Shan, Junbo Qi, Yan Bai, Dengjie Li, Jiachen Luo, Yidong Wang, Yong Dai, Zenglin Xu, Bin Shen, Qifan Wang, Jian Tang, Xiaozhu Ju

机构 * X-Humanoid Imperial College London(帝国理工学院) Peking University(北京大学) University of Manchester(曼彻斯特大学) Westlake University(西湖大学) Fudan University(复旦大学) Waseda University(早稻田大学) Nvidia Queen Mary University of London(伦敦大学玛丽女王学院) Celonis AI Meta AI

AI总结 本文提出DPPO框架,通过监督微调与强化学习交替训练,提升具身智能系统在稀疏数据下的学习效率,并在性能和参数规模上取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13161 2025-11-21 cs.CV

Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning

通过结构化多视频协作推理增强视频大语言模型

Zhihao He, Tianyao He, Yun Xu, Tieyuan Chen, Huabin Liu, Chaofan Gan, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

AI总结 本文提出一种多视频协作框架,通过结构化视频表示和图融合模块提升视频大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13246 2025-11-21 cs.CL cs.AI

Atomic Calibration of LLMs in Long-Form Generations

大语言模型在长文本生成中的原子校准

Caiqi Zhang, Ruihan Yang, Zhisong Zhang, Xinting Huang, Sen Yang, Dong Yu, Nigel Collier

机构 * University of Cambridge(剑桥大学) Fudan University(复旦大学) Tencent AI Lab(腾讯AI实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究提出原子校准方法,用于改进大语言模型在长文本生成中的校准能力,揭示置信度方法与生成过程中置信度变化的关联。

Comments ACL 2025 KnowFM Oral / AACL-IJCNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏