arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2025-12-09 至 2025-12-09 共收录 13
2512.07747 2025-12-09 cs.CV

Unison: A Fully Automatic, Task-Universal, and Low-Cost Framework for Unified Understanding and Generation

Unison: 一个完全自动、任务通用且低成本的统一理解和生成框架

Shihao Zhao, Yitong Chen, Zeyinzi Jiang, Bojia Zi, Shaozhe Hao, Yu Liu, Chaojie Mao, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 Unison提出一个低成本、全自动的多模态理解和生成框架,通过两阶段方案实现任务自适应,覆盖多种理解和生成任务,提升生成质量与自动化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07525 2025-12-09 cs.CL

Beyond Real: Imaginary Extension of Rotary Position Embeddings for Long-Context LLMs

超越现实:旋转位置嵌入的虚数扩展用于长上下文LLM

Xiaoran Liu, Yuerong Song, Zhigeng Liu, Zengfeng Huang, Qipeng Guo, Zhaoxiang Liu, Shiguo Lian, Ziwei He, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) China Unicom(中国联合网络通信集团)

AI总结 本文提出通过复数扩展提升旋转位置嵌入,以增强长上下文LLM对位置信息的建模能力。

Comments 20 pages, 6 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07130 2025-12-09 cs.RO cs.CV

Mimir: Hierarchical Goal-Driven Diffusion with Uncertainty Propagation for End-to-End Autonomous Driving

Mimir:基于不确定性传播的分层目标驱动扩散用于端到端自动驾驶

Zebin Xing, Yupeng Zheng, Qichao Zhang, Zhixing Ding, Pengxuan Yang, Songen Gu, Zhongpu Xia, Dongbin Zhao

机构 * Institue of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) China University of Geosciences(中国地质大学) Fudan University(复旦大学)

AI总结 Mimir通过不确定性传播和多速率指导机制,提升端到端自动驾驶中轨迹生成的鲁棒性和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06963 2025-12-09 cs.RO cs.AI cs.CV

VideoVLA: Video Generators Can Be Generalizable Robot Manipulators

VideoVLA: 视频生成器可以成为通用的机器人操作器

Yichao Shen, Fangyun Wei, Zhiying Du, Yaobo Liang, Yan Lu, Jiaolong Yang, Nanning Zheng, Baining Guo

机构 * IAIR, Xi’an Jiaotong University(人工智能研究院、西安交通大学) Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学)

AI总结 VideoVLA通过将视频生成模型转化为机器人VLA操作器,实现了动作与视觉后果的双预测,提升机器人操作的泛化能力。

Comments Project page: https://videovla-nips2025.github.io

Journal ref The Thirty-ninth Annual Conference on Neural Information Processing Systems(NeurIPS2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04952 2025-12-09 cs.CV cs.RO

FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization

FASTer:通过神经动作分词实现高效的自回归视觉语言动作建模

Yicheng Liu, Shiduo Zhang, Zibin Dong, Baijun Ye, Tianyuan Yuan, Xiaopeng Yu, Linqi Yin, Chenhao Lu, Junhao Shi, Luca Jiang-Tao Yu, Liangtao Zheng, Tao Jiang, Jingjing Gong, Xipeng Qiu, Hang Zhao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Galaxea AI Tianjin University(天津大学) Hong Kong University(香港大学) UCSD(加州大学圣地亚哥分校)

AI总结 FASTer通过神经动作分词实现高效自回归视觉语言动作建模,提升机器人学习的推理效率和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00975 2025-12-09 cs.CV cs.LG cs.RO

MM-ACT: Learn from Multimodal Parallel Generation to Act

MM-ACT: 从多模态并行生成中学习以行动

Haotian Liang, Xinyi Chen, Bin Wang, Mingkang Chen, Yitian Liu, Yuhao Zhang, Zanxin Chen, Tianshuo Yang, Yilun Chen, Jiangmiao Pang, Dong Liu, Xiaokang Yang, Yao Mu, Wenqi Shao, Ping Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

AI总结 MM-ACT通过多模态并行生成提升机器人任务执行能力,实现96.3%的成功率。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10072 2025-12-09 cs.CL

Unilaw-R1: A Large Language Model for Legal Reasoning with Reinforcement Learning and Iterative Inference

Unilaw-R1:基于强化学习和迭代推理的法律推理大语言模型

Hua Cai, Shuang Zhao, Liang Zhang, Xuli Shen, Qing Xu, Weilin Shen, Zihao Wen, Tianke Ban

机构 * UniDT Fudan University(复旦大学)

AI总结 Unilaw-R1通过强化学习和迭代推理,提升法律推理能力,在多个基准测试中超越同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03764 2025-12-09 cs.LG stat.ME stat.ML

Covariate-Elaborated Robust Partial Information Transfer with Conditional Spike-and-Slab Prior

协变量细化的鲁棒部分信息转移与条件尖峰- slab先验

Ruqian Zhang, Yijiao Zhang, Annie Qu, Zhongyi Zhu, Juan Shen

机构 * Department of Statistics and Data Science, Fudan University(复旦大学统计与数据科学系) Department of Biostatistics, Epidemiology and Informatics, University of Pennsylvania(宾夕法尼亚大学生物统计学、流行病学与信息学系) Department of Statistics and Applied Probability, University of California, Santa Barbara(加州大学圣芭芭拉分校统计学与应用概率系)

AI总结 本文提出CONCERT方法,通过条件尖峰- slab先验实现高维数据的鲁棒部分信息转移,同时完成变量选择与信息转移,提升迁移学习性能。

Comments 35 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06865 2025-12-09 cs.CV

Spatial Retrieval Augmented Autonomous Driving

空间检索增强的自动驾驶

Xiaosong Jia, Chenhe Zhang, Yule Jiang, Songbur Wong, Zhiyuan Zhang, Chen Chen, Shaofeng Zhang, Xuanhe Zhou, Xue Yang, Junchi Yan, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Jiao Tong University(上海交通大学) Key Laboratory of Target Cognition and Application Technology, Aerospace Information Research Institute, Chinese Academy of Sciences(目标认知与应用技术重点实验室,航天信息研究所,中国科学院) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出空间检索范式,通过引入离线地理图像提升自动驾驶任务性能,扩展nuScenes数据集并建立多个基准测试。

Comments Demo Page: https://spatialretrievalad.github.io/ with open sourced code, dataset, and checkpoints

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06782 2025-12-09 cs.LG

Measuring Over-smoothing beyond Dirichlet energy

超越狄利克雷能量的过度平滑测量

Weiqi Guan, Zihao Shi

机构 * School of Mathematical Sciences, Fudan University(复旦大学数学学院)

AI总结 本文提出了一种基于更高阶特征导数能量的节点相似性度量,揭示了过度平滑衰减率与图拉普拉西昂谱隙的内在联系,并展示了基于注意力的GNN在该指标下的过度平滑问题。

Comments 17 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06726 2025-12-09 cs.CV cs.AI cs.CL

The Role of Entropy in Visual Grounding: Analysis and Optimization

熵在视觉定位中的作用:分析与优化

Shuo Li, Jiajun Sun, Zhihao Zhang, Xiaoran Fan, Senjie Jin, Hui Li, Yuming Yang, Junjie Ye, Lixing Shen, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Hikvision Research Institute(海康威视研究院)

AI总结 本文提出ECVGPO算法,通过熵控制优化视觉定位任务,提升探索与利用的平衡,实现多基准的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18886 2025-12-09 cs.LG cs.AI

A Survey on Diffusion Models for Time Series and Spatio-Temporal Data

时间序列和时空数据扩散模型综述

Yiyuan Yang, Ming Jin, Haomin Wen, Chaoli Zhang, Yuxuan Liang, Lintao Ma, Yi Wang, Chenghao Liu, Bin Yang, Zenglin Xu, Shirui Pan, Qingsong Wen

机构 * University of Oxford(牛津大学) Griffith University(格里菲斯大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang Normal University(浙江师范大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The University of Hong Kong(香港大学) Salesforce Research(Salesforce研究) East China Normal University(东华大学) Fudan University(复旦大学)

AI总结 本文综述了扩散模型在时间序列和时空数据中的应用,系统梳理了模型类别、任务类型及实际应用场景,为后续研究提供基础。

Comments Accepted by ACM Computing Surveys; 37 pages; Github Repo: https://github.com/yyysjz1997/Awesome-TimeSeries-SpatioTemporal-Diffusion-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02278 2025-12-09 cs.CV

SCMM: Calibrating Cross-modal Representations for Text-Based Person Search

SCMM:基于文本的人脸搜索的跨模态表示校准

Jing Liu, Donglai Wei, Yang Liu, Sipeng Zhang, Tong Yang, Wei Zhou, Weiping Ding, Victor C. M. Leung

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) Department of Electrical and Computer Engineering, The University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) MEGVII Technology(MEGVII技术) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) School of AI and CS, Nantong University(南通大学人工智能与计算机科学学院) Academy of Artificial Intelligence, SMBU(SMBU人工智能学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)

AI总结 SCMM通过缝校准和掩码建模方法,提升跨模态表示学习在文本驱动的人脸搜索中的性能。

Comments 11 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏