arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

2026-01-05 至 2026-01-05 共收录 6
2601.00659 2026-01-05 cs.CV

CRoPS: A Training-Free Hallucination Mitigation Framework for Vision-Language Models

CRoPS:一种用于视觉-语言模型的无训练幻觉缓解框架

Neeraj Anand, Samyak Jha, Udbhav Bamba, Rahul Rahaman

机构 * Indian Institute of Technology (ISM)(印度理工学院(ISM)) Transmute AI National University of Singapore(新加坡国立大学)

AI总结 CRoPS通过选择性移除关键文本标记和广义对比解码,有效缓解视觉-语言模型的幻觉问题,提升CHAIR分数20%并优于现有无训练方法。

Comments Accepted at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00617 2026-01-05 cs.CV cs.AI

Noise-Robust Tiny Object Localization with Flows

具有流的抗噪声微小目标定位

Huixin Sun, Linlin Yang, Ronyu Chen, Kerui Gu, Baochang Zhang, Angela Yao, Xianbin Cao

机构 * Beihang University(北京航空航天大学) Communication University of China(中国传媒大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出TOLF框架,利用归一化流和不确定性引导优化,提升微小目标定位的抗噪声能力,并在AI-TOD数据集上提升AP 1.2%。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00327 2026-01-05 cs.CV cs.AI

HarmoniAD: Harmonizing Local Structures and Global Semantics for Anomaly Detection

HarmoniAD: 通过协调局部结构与全局语义进行异常检测

Naiqi Zhang, Chuancheng Shi, Jingtong Dou, Wenhua Wu, Fei Shen, Jianhua Cao

机构 * Tianjin University of Science and Technology(天津科技大学) The University of Sydney(悉尼大学) National University of Singapore(新加坡国立大学)

AI总结 HarmoniAD通过协调局部结构与全局语义,提出一种双分支框架以提高异常检测的灵敏度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22905 2026-01-05 cs.CV

JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation

JavisGPT:一种用于声音-视频理解和生成的统一多模态大语言模型

Kai Liu, Jungang Li, Yuchong Sun, Shengqiong Wu, Jianzhang Gao, Daoan Zhang, Wei Zhang, Sheng Jin, Sicheng Yu, Geng Zhan, Jiayi Ji, Fan Zhou, Liang Zheng, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * ZJU(浙江大学) NUS(国立新加坡大学) HKUST(GZ)(香港科技大学(广州)) RUC(中国人民大学) HZCU(杭州电子科技大学) NTU(国立台湾大学) SMU(新加坡国立大学) USYD(澳大利亚悉尼大学) ANU(澳大利亚国立大学)

AI总结 JavisGPT是一种统一多模态大语言模型,通过三阶段训练流程在声音-视频理解和生成任务中表现出色,尤其在复杂和时间同步场景中表现更优。

Comments Accepted by NeurIPS as a Spotlight paper. Code: https://github.com/JavisVerse/JavisGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14984 2026-01-05 cs.RO cs.AI cs.LG cs.SY eess.SY

The Role of Touch: Towards Optimal Tactile Sensing Distribution in Anthropomorphic Hands for Dexterous In-Hand Manipulation

触觉的作用:在拟人手部中实现灵巧在手操作的触觉传感分布优化

João Damião Almeida, Egidio Falotico, Cecilia Laschi, José Santos-Victor

机构 * VisLab, Institute for Systems Soft Robotics Lab National University of Singapore, Singapore BRAIR Lab, BioRobotics Institute Scuola Superiore Sant'Anna, Pisa, Italia

AI总结 本文研究了在拟人手部中触觉传感分布对在手操作任务的影响,通过分析不同区域的触觉反馈对深度强化学习控制策略的影响,提出了优化触觉传感配置以提高操作效率和准确性的方法。

Journal ref Proc. IEEE Int. Conf. on Networking, Sensing and Control (ICNSC), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15298 2026-01-05 cs.NE cs.CL cs.LG

Sorbet: A Neuromorphic Hardware-Compatible Transformer-Based Spiking Language Model

Sorbet:一种兼容神经形态硬件的基于Transformer的脉冲语言模型

Kaiwen Tang, Zhanglu Yan, Weng-Fai Wong

机构 * School of Computing, National University of Singapore, Singapore, Singapore(新加坡国立大学计算机学院)

AI总结 Sorbet是一种基于Transformer的脉冲语言模型,通过PTsoftmax和BSPN替代高能耗操作,实现高效能的神经形态硬件兼容性。

Comments Accepted by ICML 2025. Camera-ready version

Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏