arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

2026-01-29 至 2026-01-29 共收录 8
2601.20687 2026-01-29 cs.LG

Positive-Unlabeled Reinforcement Learning Distillation for On-Premise Small Models

基于正例-未标记强化学习的本地小型模型蒸馏

Zhiqiang Kou, Junyang Chen, Xin-Qiang Cai, Xiaobo Xia, Ming-Kun Xie, Dong-Dong Wu, Biao Liu, Yuheng Jia, Xin Geng, Masashi Sugiyama, Tat-Seng Chua

机构 * Hong Kong Polytechnic University(香港理工大学) Southeast University(东南大学) National University of Singapore(新加坡国立大学) University of Tokyo(东京大学)

AI总结 本文提出了一种基于正例-未标记强化学习的本地小型模型蒸馏方法,无需人工标注或奖励模型,通过本地训练循环实现偏好优化,实验证明在低成本环境下性能优异。

Comments 22 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20668 2026-01-29 cs.RO

GPO: Growing Policy Optimization for Legged Robot Locomotion and Whole-Body Control

GPO:用于四足机器人运动和全身控制的生长策略优化

Shuhao Liao, Peizhuo Li, Xinrong Yang, Linnan Chang, Zhaoxin Fan, Qing Wang, Lei Shi, Yuhong Cao, Wenjun Wu, Guillaume Sartoretti

机构 * Beihang University, China(北京航空航天大学) Department of Mechanical Engineering, National University of Singapore, Singapore(新加坡国立大学机械工程系) Henan Univeristy, China(河南大学)

AI总结 GPO通过动态动作转换优化腿部机器人运动和全身控制,提供稳定训练和高效探索的通用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19750 2026-01-29 cs.MM cs.CV cs.IR

Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues

在电子商务目录中评估多模态大语言模型用于缺失模态补全

Junchen Fu, Wenhao Deng, Kaiwen Zheng, Ioannis Arapakis, Yu Ye, Yongxin Ni, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Telefónica Scientific Research(电信科研机构) National University of Singapore(新加坡国立大学) Shandong University(山东大学)

AI总结 本文研究了多模态大语言模型在电子商务目录中补全缺失模态的能力,通过MMPCBench基准测试发现MLLMs在细粒度对齐上存在不足,并探索了GRPO方法以提升补全效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18811 2026-01-29 cs.LG q-fin.CP q-fin.PM quant-ph

Variational Quantum Circuit-Based Reinforcement Learning for Dynamic Portfolio Optimization

基于变分量子电路的强化学习用于动态投资组合优化

Vincent Gurgul, Ying Chen, Stefan Lessmann

机构 * Chair of Information Systems Humboldt University Berlin(信息系统教授 Humboldt 大学柏林) Department of Mathematics National University of Singapore(数学系 新加坡国立大学) Bucharest University of Economic Studies(布加勒斯特经济大学)

AI总结 本文提出基于变分量子电路的量子强化学习方法,用于动态投资组合优化,展示了其在风险调整性能上的竞争力,并探讨了实际部署中的延迟问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18631 2026-01-29 cs.AI cs.CL cs.CV cs.MA

AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning

AdaReasoner: 多步骤视觉推理中的动态工具协调

Mingyang Song, Haoyu Sun, Jiawei Gu, Linjie Li, Luxin Xu, Ranjay Krishna, Yu Cheng

机构 * Fudan University(复旦大学) Tongji University(同济大学) National University of Singapore(新加坡国立大学) University of Washington(华盛顿大学) University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 AdaReasoner通过动态工具协调提升多模态模型的视觉推理能力,实现工具自适应和泛化,超越现有系统性能。

Comments 28 pages, 10 figures and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04480 2026-01-29 cs.AI

FourierCSP: Differentiable Constraint Satisfaction Problem Solving by Walsh-Fourier Expansion

FourierCSP: 通过沃尔什-傅里叶展开实现可微约束满足问题求解

Yunuo Cen, Zixuan Wang, Jintao Zhang, Zhiwei Zhang, Xuanyao Fong

机构 * Department of Electrical and Computer Engineering, National University of Singapore, Singapore(新加坡国立大学电子与计算机工程系) Department of Computer Science, Rice University, Houston, Texas, United States(美国得克萨斯州休斯敦市 Rice 大学计算机科学系)

AI总结 FourierCSP通过沃尔什-傅里叶展开实现对通用约束满足问题的高效求解,扩展了连续局部搜索框架,提高了求解效率并推动神经符号整合的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21789 2026-01-29 cs.MA cs.CV

Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow

视觉多智能体系统:通过视觉流缓解幻觉雪球效应

Xinlei Yu, Chengming Xu, Guibin Zhang, Yongbo He, Zhangquan Chen, Zhucun Xue, Jiangning Zhang, Yue Liao, Xiaobin Hu, Yu-Gang Jiang, Shuicheng Yan

机构 * National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯优图实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 本文提出ViF方法,通过视觉流和注意力重新分配缓解多智能体系统中的视觉幻觉雪球效应,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19180 2026-01-29 cs.CR cs.AI

Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning

通过主动安全推理增强模型对劫持的防御

Xianglin Yang, Gelei Deng, Jieming Shi, Tianwei Zhang, Jin Song Dong

机构 * School of Computing(计算学院) National University of Singapore(新加坡国立大学) School of Computer Science and Engineering(计算机科学与工程学院) Nanyang Technological University(南洋理工大学) Department of Computing(计算系) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出SCoT方法,通过主动安全推理提升模型对劫持的防御能力,有效减少对分布外问题和对抗操纵的易感性。

详情

展开后加载摘要…

URL PDF HTML 收藏