arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2025-12-12 至 2025-12-12 共收录 6
2512.10522 2025-12-12 cs.LG

Disentangled and Distilled Encoder for Out-of-Distribution Reasoning with Rademacher Guarantees

解耦并压缩的编码器用于具有Rademacher保证的分布外推理

Zahra Rahiminasab, Michael Yuhas, Arvind Easwaran

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Nanyang Technological University(南洋理工大学) Energy Research Institute(能源研究研究所)

AI总结 本文提出了解耦压缩编码器框架,通过约束优化保持解耦性,以减少模型大小用于资源受限设备的分布外推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05104 2025-12-12 cs.CV

EvoIR: Towards All-in-One Image Restoration via Evolutionary Frequency Modulation

EvoIR:通过进化频率调制实现全方位图像修复

Jiaqi Ma, Shengkai Hu, Xu Zhang, Jun Wan, Jiaxing Huang, Lefei Zhang, Salman Khan

机构 * MBZUAI Abu Dhabi, UAE(阿布扎赫德MBZUAI) ZUEL Wuhan, China(武汉中南大学) Wuhan University Wuhan, China(武汉大学) Nanyang Technological University Singapore(新加坡南洋理工大学)

AI总结 EvoIR通过进化频率调制实现全方位图像修复,结合频率调制模块和进化优化策略,提升图像修复的结构保真度和细节质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03040 2025-12-12 cs.CV cs.AI

Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation

Video4Spatial: 通过基于场景的视频生成实现视觉空间智能

Zeqi Xiao, Yiwei Zhao, Lingxiao Li, Yushi Lan, Ning Yu, Rahul Garg, Roshni Cooper, Mohammad H. Taghavi, Xingang Pan

机构 * Netflix Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Eyeline Studios

AI总结 Video4Spatial通过仅使用视频数据训练的生成模型,实现了复杂空间任务的视觉空间智能,展示了视频生成模型在空间推理中的潜力。

Comments Project page at https://xizaoqu.github.io/video4spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15365 2025-12-12 eess.SY cs.LG cs.MA cs.SY

TranSimHub:A Unified Air-Ground Simulation Platform for Multi-Modal Perception and Decision-Making

TranSimHub:一个多模态感知与决策的空地协同仿真平台

Maonan Wang, Yirong Chen, Yuxin Cai, Aoyu Pang, Yuejiao Xie, Zian Ma, Chengcheng Xu, Kemou Jiang, Ding Wang, Laurent Roullet, Chung Shue Chen, Zhiyong Cui, Yuheng Kan, Michael Lepech, Man-On Pun

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai AI Laboratory(上海人工智能实验室) Stanford University(斯坦福大学) Nanyang Technological University(南洋理工大学) SenseTime Group Ltd(商汤科技有限公司) Beihang University(北京航空航天大学) Nokia Bell Labs(诺基亚贝尔实验室)

AI总结 TranSimHub是一个用于空地协同智能的统一仿真平台,支持多模态感知与决策研究,提供同步渲染和可控场景编辑功能。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17552 2025-12-12 cs.CL cs.AI

Can LLMs Reason Over Non-Text Modalities in a Training-Free Manner? A Case Study with In-Context Representation Learning

LLMs能否在无训练模式下推理非文本模态?一种基于上下文表示学习的案例研究

Tianle Zhang, Wanlong Fang, Jonathan Woo, Paridhi Latawa, Deepak A. Subramanian, Alvin Chan

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) AI-X, Interdisciplinary Graduate Programme, Nanyang Technological University(南洋理工大学人工智能交叉研究生项目) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院) Centre of AI in Medicine (C-AIM), Nanyang Technological University(南洋理工大学医学人工智能中心) University of Toronto(多伦多大学) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里洛妇女医院) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出ICRL框架,使LLMs在无训练情况下利用非文本模态表示,通过少量学习实现多模态推理,为适应性泛化提供新方向。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19486 2025-12-12 eess.SY cs.LG cs.MA cs.SY

VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture

VLMLight:通过视觉-语言元控制与双分支推理架构实现安全关键的交通信号控制

Maonan Wang, Yirong Chen, Aoyu Pang, Yuxin Cai, Chung Shue Chen, Yuheng Kan, Man-On Pun

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Nokia Bell Labs(诺基亚贝尔实验室) Fourier Intelligence(Fourier智能)

AI总结 VLMLight通过视觉-语言元控制与双分支推理架构,实现安全关键的交通信号控制,显著减少紧急车辆等待时间并提升系统安全性。

Comments 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏