arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

2026-02-09 至 2026-02-09 共收录 6
2602.06820 2026-02-09 cs.AI

ScaleEnv: Scaling Environment Synthesis from Scratch for Generalist Interactive Tool-Use Agent Training

ScaleEnv: 从零开始构建通用交互工具使用智能体训练的环境合成

Dunwei Tu, Hongyan Hao, Hansi Yang, Yihao Chen, Yi-Kai Zhang, Zhikang Xia, Yu Yang, Yueqing Sun, Xingchen Liu, Furao Shen, Qi Gu, Hui Su, Xunliang Cai

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,中国南京) Institute of Computer Science and Technology, Harbin Institute of Technology (Shenzhen), Shenzhen, China(计算机科学与技术学院,哈尔滨工业大学(深圳),中国深圳) School of Statistics, East China Normal University, Shanghai, China(统计学学院,华东师范大学,中国上海)

AI总结 ScaleEnv通过从零构建交互式环境和可验证任务,提升通用智能体在多领域工具使用任务中的泛化能力与学习鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06616 2026-02-09 cs.CR cs.LG

Confundo: Learning to Generate Robust Poison for Practical RAG Systems

Confundo: 学习生成稳健的毒药以应对实际RAG系统

Haoyang Hu, Zhejun Jiang, Yueming Lyu, Junyuan Zhang, Yi Liu, Ka-Ho Chow

机构 * The University of Hong Kong(香港大学) Nanjing University(南京大学) City University of Hong Kong(香港城市大学)

AI总结 Confundo是一种学习生成毒药的框架,通过微调大型语言模型以提高RAG系统的鲁棒性和隐蔽性,有效应对实际系统中的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06353 2026-02-09 cs.LG

Enhance and Reuse: A Dual-Mechanism Approach to Boost Deep Forest for Label Distribution Learning

增强与重用:一种双机制方法用于提升深度森林用于标签分布学习

Jia-Le Xu, Shen-Huan Lyu, Yu-Nian Wang, Ning Chen, Zhihao Qu, Bin Tang, Baoliu Ye

机构 * Key Laboratory of Water Big Data Technology of Ministry of Water Resources, Hohai University, Nanjing 211100, China(水利部水大数据技术重点实验室,河海大学,南京) College of Computer Science and Software Engineering, Hohai University, Nanjing 211100, China(计算机科学与软件工程学院,河海大学,南京) Department of Computer Science, City University of Hong Kong, Hong Kong 999077, China(计算机科学系,香港城市大学,香港) National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing 210023, China(新型软件技术国家实验室,南京大学,南京)

AI总结 本文提出ERDF方法,通过特征增强和测量感知的特征重用机制,提升深度森林在标签分布学习中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03048 2026-02-09 cs.LG cs.AI

CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs

CoBA-RL:面向大语言模型强化学习的基于能力的预算分配

Zhiyuan Yao, Yi-Kai Zhang, Yuxin Chen, Yueqing Sun, Zishan Xu, Yu Yang, Tianhao Hu, Qi Gu, Hui Su, Xunliang Cai

机构 * Zhejiang University(浙江大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 CoBA-RL通过基于能力的价值函数和堆贪心策略,优化大语言模型强化学习中的预算分配,提升训练效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01299 2026-02-09 cs.AI cs.LG

Scalable In-Context Q-Learning

可扩展的上下文Q学习

Jinmei Liu, Fuhong Liu, Zhenhong Sun, Jianye Hao, Huaxiong Li, Bo Wang, Daoyi Dong, Chunlin Chen, Zhi Wang

机构 * Nanjing University(南京大学) Australian National University(澳大利亚国立大学) Tianjin University(天津大学) University of Technology Sydney(悉尼大学)

AI总结 本文提出S-ICQL框架,通过动态规划和世界建模实现高效的奖励最大化和任务泛化,适用于决策领域。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06072 2026-02-09 cs.DC cs.LG

PackInfer: Compute- and I/O-Efficient Attention for Batched LLM Inference

PackInfer: 用于批量LLM推理的计算和I/O高效注意力

Rui Ning, Wei Zhang, Fan Lai

机构 * Nanjing University, Nanjing, China(南京大学) Siebel Center for Computer Science, University of Illinois Urbana-Champaign, Urbana, IL, USA(伊利诺伊大学厄巴纳-香槟分校计算机科学中心)

AI总结 PackInfer通过高效计算和I/O机制优化批量LLM推理,显著降低延迟并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏