机构
*
Qizhi Institute(启智研究院)
;
Dept. of Computer Science, Tsinghua University(清华大学计算机科学系)
;
College of AI, Tsinghua University(清华大学人工智能学院)
;
Engineering Department, National University of Singapore(新加坡国立大学工程系)
;
Dept. of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)
;
IIIS, Tsinghua University(清华大学人工智能研究院)
;
College of Software, Northeastern University(东北大学软件学院)
PACT: Privileged Trace Co-Training for Multi-Turn Tool-Use Agents
PACT: 多轮工具使用智能体的特权轨迹协同训练
Zhenbang Du, Jun Luo, Zhiwei Zheng, Xiangchi Yuan, Kejing Xia, Dachuan Shi, Qirui Jin, Qijia He, Shaofeng Zou, Yingbin Liang, Wenke Lee
机构
*
Georgia Institute of Technology(佐治亚理工学院)
;
Ohio State University(俄亥俄州立大学)
;
University of Pennsylvania(宾夕法尼亚大学)
;
Arizona State University(亚利桑那州立大学)
CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning
CapRL++:基于可验证奖励的统一强化学习用于密集图像和视频描述生成
Penghui Yang, Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Yibin Wang, Yujie Zhou, Jiazi Bu, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin
机构
*
Tsinghua University(清华大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Microsoft(微软)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Shanghai Innovation Institute(上海创新研究院)
;
Alibaba Cloud(阿里云)
;
The Chinese University of Hong Kong(香港中文大学)
Hi-GaTA: Hierarchical Gated Temporal Aggregation Adapter for Surgical Video Report Generation
Hi-GaTA:用于外科视频报告生成的分层门控时间聚合适配器
Kedi Sun, Chaohui Dang, Yue Feng, James Glasbey, Theodoros N. Arvanitis, Le Zhang
机构
*
School of Engineering, College of Engineering and Physical Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学工程学院)
;
School of Computer Science, University of Birmingham, Birmingham, UK(英国伯明翰大学计算机科学学院)
;
Department of Applied Health Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学应用健康科学系)
专题命中
指令微调
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
融合监督学习与强化学习微调的前缀采样
Zeyu Huang, Tianhao Cheng, Zihan Qiu, Zili Wang, Yinghui Xu, Edoardo M. Ponti, Ivan Titov
机构
*
ILCC, University of Edinburgh(爱丁堡大学ILCC)
;
Fudan University(复旦大学)
;
Qwen Team, Alibaba Group(阿里集团Qwen团队)
;
ILLC, University of Amsterdam(阿姆斯特丹大学ILLC)
DiZiNER: Disagreement-guided Instruction Refinement via Pilot Annotation Simulation for Zero-shot Named Entity Recognition
DiZiNER:通过试点注释模拟的分歧引导指令细化用于零样本命名实体识别
Siun Kim, Hyung-Jin Yoon
机构
*
Seltasquare Seoul, Korea(首尔韩国Seltasquare)
;
Seoul National University College of Medicine(首尔国立大学医学院)
;
Biomedical Research Institute, Seoul National University Hospital(首尔国立大学医院生物医学研究所)
专题命中
指令微调
:LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
HIPO: Instruction Hierarchy via Constrained Reinforcement Learning
HIPO:通过约束强化学习实现指令层级
Keru Chen, Jun Luo, Sen Lin, Yingbin Liang, Alvaro Velasquez, Nathaniel Bastian, Shaofeng Zou
机构
*
School of ECEE Arizona State University(亚利桑那州立大学电子与计算机工程学院)
;
Department of ECE The Ohio State University(俄亥俄州立大学电子工程系)
;
Computer Science Department University of Houston(休斯顿大学计算机科学系)
;
College of Engineering & Applied Science CU Boulder(科罗拉多大学博尔德分校工程与应用科学学院)
;
Dept. of Electrical Engineering & Computer Science United States Military Academy(美国军事学院电子工程与计算机科学系)
专题命中
指令微调
:LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
Generalization of RLVR Using Causal Reasoning as a Testbed
使用因果推理作为测试平台的RLVR泛化
Brian Lu, Hongyu Zhao, Shuo Sun, Hao Peng, Rui Ding, Hongyuan Mei
机构
*
Johns Hopkins University(约翰霍普金斯大学)
;
University of Maryland, College Park(马里兰大学学院公园分校)
;
University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Microsoft Research Asia(微软亚洲研究院)
;
Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)
专题命中
指令微调
:LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
Distilling Expert Surgical Knowledge: How to train local surgical VLMs for anatomy explanation in Complete Mesocolic Excision
萃取专家手术知识:如何训练局部手术VLMs用于完全网膜切除术的解剖解释
Lennart Maack, Julia-Kristin Graß, Lisa-Marie Toscha, Nathaniel Melling, Alexander Schlaefer
机构
*
1 Institute of Medical Technology
;
Intelligent Systems, Hamburg University of Technology, Hamburg, Germany 2 Department of General, Visceral
;
Thoracic Surgery, University Medical Center Hamburg-Eppendorf, Hamburg, Germany
专题命中
指令微调
:LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)