arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2025-12-02 至 2025-12-02 共收录 13
2512.02009 2025-12-02 cs.CV

AirSim360: A Panoramic Simulation Platform within Drone View

AirSim360:无人机视角下的全景模拟平台

Xian Ge, Yuling Pan, Yuhang Zhang, Xiang Li, Weijun Zhang, Dizhe Zhang, Zhaoliang Wan, Xin Lin, Xiangkai Zhang, Juntao Liang, Jason Li, Wenjie Jiang, Bo Du, Ming-Hsuan Yang, Lu Qi

机构 * Insta360 Research(Insta360研究机构) Wuhan University(武汉大学) University of California, San Diego(加州大学圣地亚哥分校) Nanyang Technological University(南洋理工大学) University of California, Merced(加州大学默塞德分校) Shenzhen University(深圳大学)

AI总结 AirSim360 是一个基于无人机视角的全景模拟平台,通过渲染对齐的数据标注、交互式行人建模和自动轨迹生成,实现全方位场景采样和空间智能研究。

Comments Project Website: https://insta360-research-team.github.io/AirSim360-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01960 2025-12-02 cs.CV cs.HC

SpriteHand: Real-Time Versatile Hand-Object Interaction with Autoregressive Video Generation

SpriteHand: 实时多样的手-物体交互与自回归视频生成

Zisu Li, Hengye Lyu, Jiaxin Shi, Yufeng Zeng, Mingming Fan, Hanwang Zhang, Chen Liang

机构 * HKUST (Guangzhou)(香港科技大学(广州)) XMax.AI Ltd.(XMax人工智能有限公司) Nanyang Technological University(南洋理工大学)

AI总结 SpriteHand通过自回归视频生成框架实现实时高质量手-物体交互视频合成,支持多种物体和运动模式,具有高视觉真实性和物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01446 2025-12-02 cs.RO

$\mathbf{M^3A}$ Policy: Mutable Material Manipulation Augmentation Policy through Photometric Re-rendering

M³A策略:通过光度重渲染的可变材料操控增强策略

Jiayi Li, Yuxuan Hu, Haoran Geng, Xiangyu Chen, Chuhao Zhou, Ziteng Cui, Jianfei Yang

机构 * Tsinghua University(清华大学) MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室) University of California, Berkeley(加州大学伯克利分校) The University of Tokyo(东京大学)

AI总结 M³A策略通过光度重渲染生成多样化演示,提升机器人跨材料操控的泛化能力。

Comments under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01335 2025-12-02 cs.CR cs.AI cs.CL

EmoRAG: Evaluating RAG Robustness to Symbolic Perturbations

EmoRAG:评估RAG对符号扰动的鲁棒性

Xinyun Zhou, Xinfeng Li, Yinan Peng, Ming Xu, Xuanwang Zhang, Miao Yu, Yidong Wang, Xiaojun Jia, Kun Wang, Qingsong Wen, XiaoFeng Wang, Wei Dong

机构 * ZJU Hangzhou China(浙江大学杭州校区) NTU Singapore(南洋理工大学) Hengxin Tech. Singapore(新加坡恒心科技) NUS Singapore(国立新加坡大学) NJU Nanjing China(南京大学) PKU Beijing China(北京大学)

AI总结 EmoRAG研究揭示RAG系统对细微表情符号扰动的鲁棒性问题,发现单个表情符号可导致检索严重误导,并提出针对性防御措施。

Comments Accepted to ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01223 2025-12-02 cs.CV cs.AI

S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance

S$^2$-MLLM:通过结构指导提升多模态大语言模型在3D视觉定位中的空间推理能力

Beining Xu, Siting Zhu, Zhao Jin, Junxian Li, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

AI总结 S$^2$-MLLM通过隐式空间推理提升多模态大语言模型在3D视觉定位中的空间推理能力,实现高效且准确的3D场景理解。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00694 2025-12-02 cs.CV

Affordance-First Decomposition for Continual Learning in Video-Language Understanding

基于可及性的分解方法用于视频-语言理解中的持续学习

Mengzhu Xu, Hanzhi Liu, Ningkang Peng, Qianyu Chen, Canran Xiao

机构 * University of Sydney(悉尼大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Nanjing Normal University(南京师范大学) Nanyang Technological University(南洋理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

AI总结 AFD通过显式分解视频-语言理解中的稳定性与适应性,实现了在持续学习中的高性能表现。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00391 2025-12-02 cs.LG cs.AI

From Coefficients to Directions: Rethinking Model Merging with Directional Alignment

从系数到方向:重新思考模型融合与方向对齐

Zhikang Chen, Sen Cui, Deheng Ye, Min Zhang, Gang Niu, Yu Zhang, Masashi Sugiyama, Tingting Zhu

机构 * University of Oxford(牛津大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) East China Normal University(华东师范大学) RIKEN(日本研究机构) The University of Tokyo(东京大学) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出方向对齐融合方法,通过统一几何框架对齐参数和特征空间的方向结构,提升模型融合的结构一致性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03657 2025-12-02 cs.CV

Dynamic Multimodal Prototype Learning in Vision-Language Models

视觉-语言模型中的动态多模态原型学习

Xingyu Zhu, Shuo Wang, Beier Zhu, Miaoge Li, Yunfan Li, Junfeng Fang, Zhicai Wang, Dongsheng Wang, Hanwang Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学) National University of Singapore(新加坡国立大学) Shenzhen University(深圳大学)

AI总结 本文提出ProtoMM框架,通过动态更新视觉粒子和多模态原型学习,提升视觉-语言模型在测试时的适应性能。

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08594 2025-12-02 cs.CV cs.LG

PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction

PointNSP: 通过下一尺度细节预测实现自回归3D点云生成

Ziqiao Meng, Qichao Wang, Zhiyang Dou, Zixing Song, Zhipeng Zhou, Irwin King, Peilin Zhao

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Hong Kong(香港大学) University of Cambridge(剑桥大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 PointNSP通过下一尺度细节预测实现自回归3D点云生成,首次在自回归范式中达到最先进的生成质量,并在参数、训练和推理效率上超越扩散基线。

Comments 24 pages; Previously this version appeared as arXiv:2510.05613 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01598 2025-12-02 cs.AI cs.HC

Prism: Mining Task-aware Domains in Non-i.i.d. IMU Data for Flexible User Perception

Prism: 在非独立同分布的IMU数据中挖掘任务感知域以实现灵活的用户感知

Yunzhe Li, Facheng Hu, Hongzi Zhu, Quan Liu, Xiaoke Zhao, Jiangang Shen, Shan Chang, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(新加坡国立大学) Ant Group(蚂蚁集团) Donghua University(东华大学)

AI总结 Prism通过挖掘任务感知的IMU数据域,实现移动设备上的灵活用户感知,提升预测精度并降低延迟。

Comments in Proceedings of IEEE INFOCOM 2025, London, United Kingdom

Journal ref Proceedings of IEEE Conference on Computer Communications (INFOCOM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02429 2025-12-02 cs.AI cs.CL

IoT-LLM: a framework for enhancing Large Language Model reasoning from real-world sensor data

IoT-LLM: 一个增强大语言模型现实世界传感器数据推理能力的框架

Tuo An, Yunjiao Zhou, Han Zou, Jianfei Yang

机构 * MARS Lab, School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore(MARS实验室,机械与航空航天工程学院,南洋理工大学,新加坡) School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore(机械与航空航天工程学院,南洋理工大学,新加坡)

AI总结 IoT-LLM通过整合物联网数据与常识知识,提升大语言模型在现实世界传感任务中的推理能力。

Comments 33 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00355 2025-12-02 cs.CV

SMamDiff: Spatial Mamba for Stochastic Human Motion Prediction

SMamDiff: 基于空间Mamba的随机人体运动预测

Junqiao Fan, Pengfei Liu, Haocong Rao

机构 * School of Computer Science, Nanyang Technological University(计算机科学学院,南洋理工大学)

AI总结 SMamDiff通过空间Mamba和余数-DCT编码提升随机人体运动预测的时空一致性,实现更高效且准确的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00300 2025-12-02 cs.CV

TGSFormer: Scalable Temporal Gaussian Splatting for Embodied Semantic Scene Completion

TGSFormer:可扩展的时序高斯点云用于具身语义场景补全

Rui Qian, Haozhi Cao, Tianchen Deng, Tianxin Hu, Weixiang Guo, Shenghai Yuan, Lihua Xie

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiaotong University(上海交通大学)

AI总结 TGSFormer通过时序高斯点云框架实现了具身语义场景补全的高精度与可扩展性。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏