arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2025-12-05 至 2025-12-05 共收录 6
2512.05111 2025-12-05 cs.CV

ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning

ARM-Thinker: 通过智能工具使用和视觉推理强化多模态生成奖励模型

Shengyuan Ding, Xinyu Fang, Ziyu Liu, Yuhang Zang, Yuhang Cao, Xiangyu Zhao, Haodong Duan, Xiaoyi Dong, Jianze Liang, Bin Wang, Conghui He, Dahua Lin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 ARM-Thinker通过智能工具使用和视觉推理提升多模态奖励模型的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05006 2025-12-05 cs.CV

Self-Supervised Learning for Transparent Object Depth Completion Using Depth from Non-Transparent Objects

利用非透明物体的深度获取进行透明物体深度补全的自监督学习

Xianghui Fan, Zhaoyu Chen, Mengyang Pan, Anping Deng, Hang Yang

机构 * Changchun Institute of Optics, Fine Mechanics and Physics, Chinese Academy of Sciences(长春光学精密机械与物理研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Fudan University(复旦大学)

AI总结 本文提出了一种自监督学习方法,通过模拟非透明区域的深度缺失来提升透明物体深度补全的性能。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04963 2025-12-05 cs.CV cs.AI

GeoPE:A Unified Geometric Positional Embedding for Structured Tensors

GeoPE:一种统一的几何位置嵌入用于结构化张量

Yupu Yao, Bowen Yang

机构 * University of Electronic Science and Technology of China(电子科技大学) Fudan University(复旦大学)

AI总结 GeoPE通过引入几何位置嵌入,有效恢复2D空间流形,提升图像分类、目标检测和3D语义分割任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04483 2025-12-05 cs.CV

DeRA: Decoupled Representation Alignment for Video Tokenization

DeRA: 解耦表示对齐用于视频标记化

Pengbo Guo, Junke Wang, Zhen Xing, Chengxu Liu, Daoguo Dong, Xueming Qian, Zuxuan Wu

机构 * Xi’an Jiaotong University(西安交通大学) Shanghai Innovation Institute(上海创新研究院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

AI总结 DeRA通过解耦时空表示学习,提升视频标记化效率和性能,并在视频生成任务中取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04058 2025-12-05 cs.CV

EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models

EVE:基于视觉-语言模型的端到端视频字幕提取

Haiyang Yu, Mengyang Zhao, Jinghui Lu, Ke Niu, Yanjie Wang, Weijie Yin, Weitao Jia, Teng Fu, Yang Liu, Jun Liu, Hong Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ByteDance Inc.(字节跳动公司) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Computing and Communications, Lancaster University(兰卡斯特大学计算机与通讯学院)

AI总结 EVE提出了一种基于视觉-语言模型的端到端视频字幕提取框架,通过双分支模块高效提取字幕及时间戳,并构建了首个大规模视频字幕数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12462 2025-12-05 physics.ao-ph cs.AI cs.LG

Towards an end-to-end artificial intelligence driven global weather forecasting system

迈向基于端到端人工智能的全球天气预报系统

Kun Chen, Lei Bai, Fenghua Ling, Peng Ye, Tao Chen, Hang Fan, Hao Chen, Yi Xiao, Kang Chen, Tao Han, Jing-Jia Luo, Wanli Ouyang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University of Information Science and Technology(南京信息工程大学)

AI总结 本文提出基于人工智能的数据同化模型Adas,并结合FengWu构建端到端全球天气预报系统,实现高精度长期天气预报。

详情

展开后加载摘要…

URL PDF HTML 收藏