arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-02-12 至 2026-02-12 共收录 6
2602.08025 2026-02-12 cs.CV cs.AI

MIND: Benchmarking Memory Consistency and Action Control in World Models

MIND:世界模型中内存一致性与动作控制的基准测试

Yixuan Ye, Xuanyu Lu, Yuxin Jiang, Yuchao Gu, Rui Zhao, Qiwei Liang, Jiachun Pan, Fengda Zhang, Weijia Wu, Alex Jinpeng Wang

机构 * CSU-JPG, Central South University(中南大学) National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

AI总结 MIND提出首个开放域闭环基准,评估世界模型的内存一致性和动作控制能力,揭示当前模型在长期记忆保持和动作空间泛化上的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16415 2026-02-12 cs.CL cs.AI cs.LG

Attributing Response to Context: A Jensen-Shannon Divergence Driven Mechanistic Study of Context Attribution in Retrieval-Augmented Generation

基于Jensen-Shannon散度的响应归因研究:一种驱动上下文归因的机理研究

Ruizhe Li, Chen Chen, Yuchen Hu, Yanjun Gao, Xi Wang, Emine Yilmaz

机构 * University of Aberdeen(阿伯丁大学) Nanyang Technological University(南洋理工大学) University College London(伦敦大学学院) University of Colorado Anschutz Medical Campus(科罗拉多大学安舒兹医学校区) University of Sheffield(谢菲尔德大学)

AI总结 本文提出基于Jensen-Shannon散度的ARC-JSD方法,实现高效准确的上下文归因,提升RAG模型的性能和效率。

Comments Accepted at ICLR 2026; Best Paper Award at COLM 2025 XLLM-Reason-Plan Workshop; Accepted at NeurIPS 2025 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10171 2026-02-12 cs.SE cs.AI

EvoCodeBench: A Human-Performance Benchmark for Self-Evolving LLM-Driven Coding Systems

EvoCodeBench:用于自演化LLM驱动编码系统的性能基准

Wentao Zhang, Jianfeng Wang, Liheng Liang, Yilei Zhao, HaiBin Wen, Zhe Zhao

机构 * Nanyang Technological University(南洋理工大学) East China University of Science and Technology(东华大学) Guangdong Ocean University(广东海洋大学) City University of Hong Kong(香港城市大学) Stanford University(斯坦福大学)

AI总结 EvoCodeBench通过跨语言对比和人类表现评估,评估自演化LLM驱动编码系统的性能提升与效率改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10161 2026-02-12 cs.CR cs.AI cs.CL

Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment

跨模态冲突下的全方位安全:漏洞、动态机制和高效对齐

Kun Wang, Zherui Li, Zhenhong Zhou, Yitong Zhang, Yan Mi, Kun Yang, Yiming Zhang, Junhao Dong, Zhongxiang Sun, Qiankun Li, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Renmin University of China(中国人民大学)

AI总结 本文提出OmniSteer方法,通过提取黄金拒绝向量和轻量级适配器提升多模态模型的安全性与通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10122 2026-02-12 cs.CY cs.AI

A Practical Guide to Agentic AI Transition in Organizations

组织中代理AI转型的实用指南

Eranga Bandara, Ross Gore, Sachin Shetty, Sachini Rajapakse, Isurunima Kularathna, Pramoda Karunarathna, Ravi Mukkamala, Peter Foytik, Safdar H. Bouk, Abdul Rahman, Xueping Liang, Amin Hass, Tharaka Hewa, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University(旧 Dominion 大学) Florida International University(佛罗里达国际大学) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学) Center for Wireless Communications, University of Oulu(无线通信中心,奥卢大学) University of Sri Jayewardenepura(斯里贾yenepura大学) Accenture Technology Labs(埃森哲技术实验室)

AI总结 本文提出了一种实用框架,帮助组织将手动流程转型为自动化代理AI系统,通过领域驱动用例识别、任务委托给AI代理及人机协同模型实现可持续的自动化与业务价值对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16659 2026-02-12 cs.LG cs.AI

Provably Robust Bayesian Counterfactual Explanations under Model Changes

可证明鲁棒的贝叶斯反事实解释 under 模型变化

Jamie Duell, Xiuyi Fan

机构 * School of Computing and Digital Technologies(计算与数字技术学院) Sheffield Hallam University(谢菲尔德哈姆大学) Lee Kong Chian School of Medicine(李科金医学院) Nanyang Technological University(南洋理工大学)

AI总结 本文提出PSCE方法,通过概率安全和鲁棒性保证,在模型变化下生成更可靠且具有判别性的反事实解释。

详情

展开后加载摘要…

URL PDF HTML 收藏