机构
*
Université de Montréal(蒙特利尔大学)
;
McGill University(麦吉尔大学)
;
Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所)
;
University of Waterloo(滑铁卢大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Huawei Noah’s Ark Lab(华为诺亚方舟实验室)
HiMPO: Hindsight-Informed Memory Policy Optimization for Less-Entangled Credit in Long-Horizon Agents
HiMPO:面向长周期智能体的后见知情记忆策略优化以减少纠缠信用分配
Jiangze Yan, Yi Shen, Wenjing Zhang, Jieyun Huang, Zhaoxiang Liu, Ning Wang, Kai Wang, Shiguo Lian
机构
*
Unicom Data Intelligence, China Unicom(联通数据智能有限公司,中国联通)
;
Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院)
机构
*
Kean University(基恩大学)
;
Case Western Reserve University(凯斯西储大学)
;
University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
The Ohio State University(俄亥俄州立大学)
;
Tongji University(同济大学)
;
Duke Kunshan University(昆山杜克大学)
;
Royal Melbourne Institute of Technology(皇家墨尔本理工大学)
Driving, Fast or Slow? Neuro-Symbolic Guidance for Motion Prediction in Multi-Modal Ground Mobility
驾驶,快或慢?多模态地面移动中运动预测的神经符号引导
Simon Kohaut, Felix Divo, Julius Hahnewald, Benedict Flade, Julian Eggert, Kristian Kersting, Devendra Singh Dhami
机构
*
Artificial Intelligence and Machine Learning Lab, TU Darmstadt(达姆施塔特工业大学人工智能与机器学习实验室)
;
Honda Research Institute(本田研究所)
;
Hessian Center for AI (hessian.AI)(黑森州人工智能中心)
;
Centre for Cognitive Science(认知科学中心)
;
German Center for AI (DFKI)(德国人工智能研究中心)
;
Uncertainty in Artificial Intelligence Lab, TU Eindhoven(埃因霍温理工大学人工智能不确定性实验室)
M*: A Modular, Extensible, Serving System for Multimodal Models
M*: 一个模块化、可扩展的多模态模型服务系统
Atindra Jha, Naomi Sagan, Keisuke Kamahori, Irmak Sivgin, Rohan Sanda, Steven Gao, Mark Horowitz, Luke Zettlemoyer, Olivia Hsu, Jure Leskovec, Baris Kasikci, Stephanie Wang
机构
*
Stanford University(斯坦福大学)
;
University of Washington(华盛顿大学)
;
Carnegie Mellon University(卡内基梅隆大学)
机构
*
Tsinghua University(清华大学)
;
Chongqing University(重庆大学)
;
Peking University(北京大学)
;
ZenoMind AI
;
Xi’an Jiaotong University(西安交通大学)
;
Beijing Institute of Technology(北京理工大学)
;
Southeast University(东南大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Joy Future Academy(京东探索研究院)
;
The University of Hong Kong(香港大学)
When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff
当强化学习在监督微调后失效:恢复模型可塑性以实现稳健的SFT到RL交接
Runze Liu, Jiashun Liu, Xu Wan, Yuqian Fu, Ling Pan
机构
*
Hong Kong University of Science and Technology(香港科技大学)
;
Zhejiang University(浙江大学)
;
State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,CASIA)
机构
*
Institute of High Performance Computing (IHPC), A*STAR, Singapore(新加坡科技研究局高性能计算研究所)
;
The Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University(同济大学道路与交通工程教育部重点实验室)
;
Meituan Inc., Shenzhen, China(美团(深圳))
;
Centre for Frontier AI Research (CFAR), A*STAR, Singapore(新加坡科技研究局前沿人工智能研究中心)
;
Nankai University(南开大学)
;
School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)