arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2025-12-02 至 2025-12-02 共收录 10
2511.23127 2025-12-02 cs.CV

DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation

DualCamCtrl: 基于双分支扩散模型的几何感知摄像机控制视频生成

Hongfei Zhang, Kanghao Chen, Zixin Zhang, Harold Haodong Chen, Yuanhuiyi Lyu, Yuqi Zhang, Shuai Yang, Kun Zhou, Yingcong Chen

机构 * HKUST (GZ)(香港科技大学) HKUST(香港科技大学) Fudan University(复旦大学) Shenzhen University(深圳大学)

AI总结 DualCamCtrl通过双分支扩散模型实现几何感知的摄像机控制视频生成,有效提升视频生成的一致性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06263 2025-12-02 cs.CV

OmniSVG: A Unified Scalable Vector Graphics Generation Model

OmniSVG: 一种统一的可扩展矢量图形生成模型

Yiying Yang, Wei Cheng, Sijin Chen, Xianfang Zeng, Fukun Yin, Jiaxu Zhang, Liao Wang, Gang Yu, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) StepFun Project(StepFun项目)

AI总结 OmniSVG通过统一框架和预训练视觉-语言模型,实现高效多模态SVG生成,提升复杂结构的表达能力,并引入大规模数据集推动SVG合成发展。

Comments 20 pages; Project Page: https://omnisvg.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01319 2025-12-02 cs.CV cs.AI

Rethinking Intracranial Aneurysm Vessel Segmentation: A Perspective from Computational Fluid Dynamics Applications

重新思考颅内动脉瘤血管分割:来自计算流体动力学应用的视角

Feiyang Xiao, Yichi Zhang, Xigui Li, Yuanye Zhou, Chen Jiang, Xin Guo, Limei Han, Yuxin Li, Fengping Zhu, Yuan Cheng

机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院) Department of Civil and Environmental Engineering, Hong Kong Polytechnic University(香港理工大学土木与环境工程系) Huashan Hospital, Fudan University(复旦大学华山医院)

AI总结 本文提出首个颅内动脉瘤血管分割数据集,结合血流动力学分析,开发两阶段框架提升分割精度与CFD应用有效性。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01312 2025-12-02 cs.CV

IVCR-200K: A Large-Scale Multi-turn Dialogue Benchmark for Interactive Video Corpus Retrieval

IVCR-200K: 一个大规模多轮对话基准数据集用于交互视频语料检索

Ning Han, Yawen Zeng, Shaohua Long, Chengqing Li, Sijie Yang, Dun Tan, Jianfeng Dong, Jingjing Chen

机构 * Xiangtan University(湘潭大学) Hunan University(湖南大学) Zhejiang Gongshang University(浙江工商大学) Fudan University(复旦大学)

AI总结 本文提出IVCR-200K数据集及基于多模态大语言模型的框架,用于交互视频语料检索,提升多轮对话式交互效果。

Comments Accepted by SIGIR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01255 2025-12-02 cs.CR cs.CL cs.SE

Large Language Models Cannot Reliably Detect Vulnerabilities in JavaScript: The First Systematic Benchmark and Evaluation

大语言模型无法可靠地检测JavaScript中的漏洞:首个系统性基准和评估

Qingyuan Fei, Xin Liu, Song Li, Shujiang Wu, Jianwei Hou, Ping Chen, Zifeng Kang

机构 * Lanzhou University(兰州大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Technology Support Center of the Cyberspace Administration of China(国家互联网信息办公室技术支撑中心) Fudan University(复旦大学) Beijing University of Posts(北京邮电大学)

AI总结 本文首次提出FORGEJS框架,构建首个系统性JavaScript漏洞检测基准ARENAJS,并揭示LLM在漏洞检测中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15605 2025-12-02 cs.RO cs.CL cs.CV

SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models

SRPO:用于视觉-语言-动作模型的自指政策优化

Senyu Fei, Siyin Wang, Li Ji, Ao Li, Shiduo Zhang, Liming Liu, Jinlong Hou, Jingjing Gong, Xianzhong Zhao, Xipeng Qiu

机构 * Fudan University(复旦大学) Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 SRPO通过自指政策优化方法,利用模型自身生成的成功轨迹作为参考,有效解决VLA-RL中的奖励稀疏问题,实现高成功率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20729 2025-12-02 cs.AI cs.HC cs.MA

Robust, Observable, and Evolvable Agentic Systems Engineering: A Principled Framework Validated via the Fairy GUI Agent

鲁棒、可观测和可进化的代理系统工程:一种经过Fairy GUI代理验证的原则性框架

Jiazheng Sun, Ruimeng Yang, Xu Han, Jiayang Niu, Mingxuan Li, Te Yang, Yongyong Lu, Xin Peng

机构 * Fudan University(复旦大学)

AI总结 本文提出了一种原则性框架,通过Fairy GUI代理验证,解决了代理系统在鲁棒性、可观测性和可进化性方面的不足,提供了可维护和可扩展的代理AI系统设计方法。

Comments 50 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23525 2025-12-02 cs.CV

Hallo4: High-Fidelity Dynamic Portrait Animation via Direct Preference Optimization

Hallo4: 通过直接偏好优化实现高保真的动态肖像动画

Jiahao Cui, Yan Chen, Mingwang Xu, Hanlin Shang, Yuxuan Chen, Yun Zhan, Zilong Dong, Yao Yao, Jingdong Wang, Siyu Zhu

机构 * Fudan University(复旦大学) Baidu Inc.(百度公司) Shanghai Innovative Institute(上海创新研究院) Nanjing University(南京大学) Alibaba Group(阿里巴巴集团)

AI总结 Hallo4通过直接偏好优化和时空运动调制,实现高保真的动态肖像动画生成,提升唇部同步、表情自然性和身体运动一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22643 2025-12-02 cs.CV

SPIRAL: Semantic-Aware Progressive LiDAR Scene Generation and Understanding

SPIRAL: 基于语义的渐进式LiDAR场景生成与理解

Dekai Zhu, Yixuan Hu, Youquan Liu, Dongyue Lu, Lingdong Kong, Slobodan Ilic

机构 * Technical University of Munich(慕尼黑技术大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 Spiral提出了一种基于范围视图的LiDAR扩散模型,能够同时生成深度、反射图像和语义地图,实现高效的3D场景生成与理解。

Comments NeurIPS 2025; 24 pages, 10 figures, 9 tables; Code at https://github.com/worldbench/SPIRAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19097 2025-12-02 cs.LG stat.ML

Towards Robust Influence Functions with Flat Validation Minima

迈向具有平坦验证极小值的鲁棒影响函数

Xichen Ye, Yifan Wu, Weizhong Zhang, Cheng Jin, Yifan Chen

机构 * Fudan University(复旦大学) Hong Kong Baptist University(香港 Baptist 大学) Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室) Innovation Center of Calligraphy and Painting Creation Technology(书法和绘画创作技术创新中心)

AI总结 本文提出了一种针对平坦验证极小值的影响函数估计方法,解决了深度学习中因验证风险尖锐性导致的影响估计不准确问题。

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏