arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-09-01 至 2026-09-01 共收录 14
2608.31022 2026-09-01 cs.AI cs.CV 新提交

MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents

MNIST-PRO:MNIST作为AI智能体的部分可观测世界回归

Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology, and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

AI总结 本研究提出MNIST-PRO基准,将MNIST数字识别转化为带回溯约束的顺序搜索任务,评估多模态模型在部分可观测性下的表现,发现智能体存在感知整合、探索持续性及信念修正三大瓶颈,凸显构建更新可靠感知状态的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30657 2026-09-01 cs.CV 新提交

InfraOcc: An Infrastructure Occupancy Benchmark with Static-to-Dynamic Reasoning

InfraOcc:具备静态-动态推理能力的基础设施占用基准测试集

Lei Yang, Xiaokai Bai, Boqi Li, Chunmian Lin, Li Wang, Ziying Song, Jiahuan Zhang, Enhui Ma, Haibao Yu, Jiaqi Ma, Kaicheng Yu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Beijing Institute of Technology(北京理工大学) Yanshan University(燕山大学) Westlake University(西湖大学) University of Hong Kong(香港大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 本文构建了首个基础设施占用基准InfraOcc,提出ProSD-Occ方法实现静态-动态渐进推理,在多赛道排名第一,为固定视角路边占用提供了新的推理范式。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30478 2026-09-01 cs.CL 新提交

Agents in the Large: Perception-Centered Architecture for Persistent Agents

大型智能体:面向持久智能体的感知中心架构

Shihan Dou, Haoxiang Jia, Shichun Liu, Feng Chen, Chenhao Huang, Yujiong Shen, Shaofan Liu, Jiayi Chen, Jiahang Lin, Honglin Guo, Qianyu He, Minghao Guo, Ziyi Ye, Pluto Zhou, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Tencent(腾讯)

AI总结 该研究提出面向持久智能体的感知中心架构(Pera),用于刻画、组织和指导持久AI智能体的发展,类比软件工程的小型到大型编程,推动语言智能体向长期自适应智能系统演进。

Comments 41 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30322 2026-09-01 cs.AI cs.CL 新提交

Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents

无知还是无能?构建面向大语言模型智能体的知识门控可验证任务

Hanlin Tian, Minhao Li, Yu Mi, Sihan Zhu, Zhao Yang, Yuxiang Wang, Hongquan Zhu, Qiufei Hu

机构 * DataGrids Shanghai University(上海大学) Peking University(北京大学) Northwestern Polytechnical University(西北工业大学) Nanyang Technological University(南洋理工大学) East China Normal University(华东师范大学)

AI总结 该研究针对大语言模型智能体任务缺乏对约定访问控制的问题,提出知识门控任务构建协议,经实验验证其有效性并发布部分任务套件与工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30319 2026-09-01 cs.CL cs.AI cs.LG 新提交

Beyond Token-Level Guidance: Inference-Time Alignment of Specialized LLMs via Cross-Family Representation Steering

超越token级引导:通过跨系列表示转向实现专用大语言模型的推理时对齐

Jin Gan, Xin Li, Jun Luo

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) College of Cryptology and Cyber Science, Nankai University(南开大学密码与网络科学学院)

AI总结 针对专用LLM推理时对齐的缺陷,提出CREST方法,通过跨系列表示转向提升安全性,同时保留领域能力,在安全基准上比基线提升达22.2%。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29896 2026-09-01 cs.RO 新提交

EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy

EMERGE-Policy:超越单一策略的机器人心智涌现

Zhirui Fang, Qingchi Yu, Ziyang Chen, Longfei Li, Haoran Ma, Keru Zhou, Xinrun Xu, Samith Va, Yuxuan Hu, Peixuan Song, Qiang Du, Bin Qian, Yongkang Deng, Xin Li, Yezhen Wang, Zhe Li, Hao Luo, Shuyan Li, Ziwei Wang, Weijian Deng, Xiu Li

机构 * Tsinghua University(清华大学) Nanjing University of Science and Technology(南京理工大学) Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学)

AI总结 EMERGE-Policy是一种图结构智能体框架,通过多角色子智能体协作划分功能子任务,无需额外微调即可在公开基准和真实机器人实验中实现出色性能,扩展了机器人策略的应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29889 2026-09-01 cs.CL 新提交

VibeJam: A User Study Platform for Web Development with Agents

VibeJam:用于智能体辅助Web开发的用户研究平台

Nishant Balepur, Connor Baumler, Valerie Chen, Eunsol Choi, Rachel Rudinger, Jordan Boyd-Graber

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

AI总结 研究推出开源浏览器平台VibeJam,支持用户与Aider智能体协作开发网站,试点显示其获资深程序员认可且初级学生用其生成的网站质量更优,可推动编码智能体相关研究。

Comments EMNLP 2026 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29887 2026-09-01 cs.CL 新提交

Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation

查看计分板:多项选择题评估的计分方案分析

Nishant Balepur, Paiheng Xu, Wei Ai, Eunsol Choi, Rachel Rudinger, Jordan Boyd-Graber

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

AI总结 该研究分析6种教育启发式计分方案对MCQA评估的影响,发现其可改变31个LLM的排名、更准确预测用户偏好,并揭示不同模型能力,还探讨了方案向其他任务的扩展。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29605 2026-09-01 cs.CL 新提交

Hindsight Memory-PRM: Supervising Memory Management with Auditable Hindsight Credit

事后记忆-PRM:通过可审计的事后信用监督记忆管理

Haoxuan Jia, Yang Liu, Yingguang Yang, Yancheng Chen, Chongyang Zhang, Hao Zheng, Qian Li, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Hao Peng, Junyu Lu, Du Cheng, Philip S. Yu, Bin Chong

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Fullive-AI Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Beijing Institute of Technology, Zhuhai(北京理工大学珠海学院) Northeastern University(东北大学) University of Illinois Chicago(芝加哥大学伊利诺伊分校)

AI总结 该研究提出Hindsight Memory-PRM,利用轨迹审计轨迹训练记忆效用评判器并确定代理奖励,在LoCoMo、LongMemEval数据集上的性能优于基线系统,实现高效的长视野LLM智能体记忆管理监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29242 2026-09-01 cs.RO 新提交

AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization

AnyWorld:用于跨 embodiments 泛化的分解式第一人称世界模型

Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

机构 * Nanyang Technological University(南洋理工大学) Institute of Advanced Intelligence and Computing, A*STAR(新加坡科技研究局高级智能与计算研究院) XPENG Robotics(小鹏机器人) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 AnyWorld 框架通过分解交互为动作、相机、embodiment 因子,将人类交互重组为机器人原生经验,生成数据可提升机器人操作性能,验证了动作校准与视觉重组的必要性。

Comments Project page: https://xpeng-robotics.github.io/anyworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29081 2026-09-01 cs.CV 新提交

AdapToPASS: Ambiguity-aware Adaptive Spherical Transformer for Panoramic Semantic Segmentation

AdapToPASS:面向全景语义分割的歧义感知自适应球形Transformer

Soumyaratna Debnath, Weiming Zhang, Shriram Damodaran, Dingwen Xiao, Addison Lin Wang

机构 * NTU Singapore(新加坡南洋理工大学) HKUST(香港科技大学)

AI总结 AdapToPASS是一种生物启发的球形Transformer,通过自适应建模歧义提升全景语义分割性能,在未见过的球形变换下较次优方法相对mIoU提升最高18.77%,轻量变体参数不足2M且性能优于紧凑基线。

Comments 25 Pages, 7 Tables, 15 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29054 2026-09-01 cs.AI 新提交

Let Prompts Bridge Defense Knowledge: Transferable Graph Purification via Vulnerability-Aware GPL

让提示桥接防御知识:通过漏洞感知GPL实现可迁移图净化

Shuomin Xue, Jingyuan Li, Ju Jia, Jingxuan Yu, Xiaojun Jia

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

AI总结 针对现有图对抗净化方法领域受限的缺陷,提出ProGAP方案,通过漏洞感知图提示学习实现可迁移图净化,性能提升1%-9%且时间消耗最多减少2.2倍。

Comments To appear in the Proceedings of the 34th ACM International Conference on Multimedia (MM '26). 10 pages, 7 figures, and 4 tables. Shuomin Xue and Jingyuan Li contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29029 2026-09-01 cs.LG cs.AI 新提交

Flow-JEPA: Flow Matching for Robust Latent Dynamics in JEPA World Models

Flow-JEPA:用于JEPA世界模型中鲁棒潜在动力学的流匹配方法

Yanchen Huo, Ziying Song, Yadan Luo

机构 * Nanyang Technological University(南洋理工大学) The University of Queensland(昆士兰大学)

AI总结 本研究针对JEPA世界模型确定性自回归预测器易累积误差且对扰动敏感的问题,提出Flow-JEPA,采用条件流匹配实现随机轨迹级预测,显著提升了干净及含噪观测下的平均成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28970 2026-09-01 cs.SD cs.AI 新提交

Diagnose, Then Refine: A Closed-Loop TTS System with AudioLLM-Guided Correction

诊断后优化:基于AudioLLM引导校正的闭环TTS系统

Zeyang Song, Tianchi Liu, Tianrui Wang, Chenglin Xu, Steven Y. Guo, Haizhou Li

机构 * National University of Singapore(新加坡国立大学) Tencent(腾讯) LIGHTSPEED(光速) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 针对开环TTS易出现韵律缺陷且指标难检测的问题,提出含AudioLLM评判器与细粒度优化器的LoopTTS框架,构建4.2万示例数据集训练优化器,实验表明其修复质量与指令遵循能力更优。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏