arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-02-02 至 2026-02-02 共收录 6
2512.19299 2026-02-02 cs.AI

Helios: A Foundational Language Model for Smart Energy Knowledge Reasoning and Application

Helios:一种面向智能能源知识推理与应用的基础语言模型

Haoyu Jiang, Fanjie Zeng, Boan Qu, Xiaojie Lin, Wei Zhong

机构 * College of Energy Engineering, Zhejiang University(浙江大学能源工程学院) Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海研究院)

AI总结 Helios是一种专为智能能源领域设计的基础语言模型,通过构建多智能体协作框架和相关数据集,提升领域知识、任务执行准确性和与人类偏好的对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22491 2026-02-02 cs.CL

SSL: Sweet Spot Learning for Differentiated Guidance in Agentic Optimization

SSL:在代理优化中差异化引导的甜蜜点学习

Jinyang Wu, Changpeng Yang, Yuhao Shen, Fangzhi Xu, Bolin Ni, Chonghua Liao, Yuchen Liu, Hongzhen Wang, Shuai Nie, Shuai Zhang, Haoran Luo, Jiaming Xu

机构 * Tsinghua University(清华大学) Xiaomi Corporation(小米公司) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 SSL通过分层奖励引导代理优化,提升解空间中的方向性优化,实现样本效率提升和跨任务迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22485 2026-02-02 cs.CR cs.AI cs.CL

FraudShield: Knowledge Graph Empowered Defense for LLMs against Fraud Attacks

FraudShield: 基于知识图谱的LLM对抗欺诈攻击防御方案

Naen Xu, Jinghuai Zhang, Ping He, Chunyi Zhou, Jun Wang, Zhihui Fu, Tianyu Du, Zhaoxiang Wang, Shouling Ji

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校) OPPO Research Institute(OPPO研究院) Zhejiang Key Laboratory of Decision Intelligence(浙江决策智能重点实验室)

AI总结 FraudShield通过构建欺诈战术-关键词知识图谱,提升LLM对抗欺诈攻击的能力,实验显示其在多个LLM和欺诈类型上表现优异,且提供可解释的防御线索。

Comments WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22475 2026-02-02 cs.LG

Continual Policy Distillation from Distributed Reinforcement Learning Teachers

从分布式强化学习教师中持续政策蒸馏

Yuxuan Li, Qijun He, Mingqi Yuan, Wen-Tse Chen, Jeff Schneider, Jiayu Chen

机构 * Department of XXX, University of YYY, Location, Country School of ZZZ, Institute of WWW, Location, Country Zhejiang University, Zhejiang, China South University of Science Hong Kong University, Hong Kong, China INFIFORCE Intelligent Technology Co., Ltd., Hangzhou, China The Hong Kong Polytechnic University, Hong Kong, China School of Computer Science, Carnegie Mellon University

AI总结 本文提出一种教师-学生框架,通过分布式强化学习训练单任务模型并持续蒸馏到通用模型,实现高效的持续强化学习。

Comments 19 pages (8 pages main text)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19700 2026-02-02 cs.LG cs.AI

Generalizable Multimodal Large Language Model Editing via Invariant Trajectory Learning

通过不变轨迹学习实现通用的多模态大语言模型编辑

Jiajie Su, Haoyuan Wang, Xiaohua Feng, Yunshan Ma, Xiaobo Xia, Yuyuan Li, Xiaolin Zheng, Jianmao Xiao, Chaochao Chen

机构 * Zhejiang University, China(浙江大学) Singapore Management University, Singapore(新加坡管理学院) National University of Singapore, Singapore(新加坡国立大学) Hangzhou Dianzi University, China(杭州电子科技大学) Jiangxi Normal University, China(江西师范大学)

AI总结 本文提出ODEit框架,通过不变轨迹学习提升多模态大语言模型的编辑可靠性、局部性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10197 2026-02-02 cs.AI

Don't Just Fine-tune the Agent, Tune the Environment

不要只微调智能体,而是微调环境

Siyuan Lu, Zechuan Wang, Hongxuan Zhang, Qintong Wu, Leilei Gan, Chenyi Zhuang, Jinjie Gu, Tao Lin

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Nanjing University(南京大学)

AI总结 本文提出环境微调方法,通过结构化课程和环境增强,使智能体无需专家轨迹即可高效学习复杂行为,实现更稳健的泛化能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏