OPDSearch+: On-Policy Distillation with RL Refinement for Search-Augmented Reasoning
OPDSearch+:用于搜索增强推理的带RL优化的在线策略蒸馏
Qinglin Ye, Zhiyuan Gu, Jingjie Xia, Yiheng Zhang, Kaiyan Zhao, Shunchao Zheng, Yuhang Mu, Wenchao Du, Yiming Wang
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Macau(澳门大学)
;
Wuhan University(武汉大学)
;
Georgia Institute of Technology(佐治亚理工学院)
;
Northwestern Polytechnical University(西北工业大学)
;
University of Hong Kong(香港大学)
From Dialogue to Execution: Mixture-of-Agents Assisted Interactive Planning for Behavior Tree-Based Long-Horizon Robot Execution
从对话到执行:基于混合代理的交互式规划用于基于行为树的长时域机器人执行
Kanata Suzuki, Kazuki Hori, Haruka Miyoshi, Shuhei Kurita, Tetsuya Ogata
机构
*
Waseda University(早稻田大学)
;
National Institute of Informatics(国家信息研究所)
;
NII Research and Development Center for Large Language Models(国家信息研究所大型语言模型研究开发中心)
;
The Graduate University for Advanced Studies (SOKENDAI)(高级研究大学研究生院(SOKENDAI))
Can large language models assist choice modelling? Insights into prompting strategies and current models' capabilities
大语言模型能否协助选择建模?关于提示策略和当前模型能力的洞察
Georges Sfeir, Gabriel Nova, Stephane Hess, Sander van Cranenburgh
机构
*
Choice Modelling Centre & Institute for Transport Studies, University of Leeds(选择建模中心及交通研究学院,利兹大学)
;
CityAI Lab, Transport and Logistics group, Engineering Systems and Services Department, TU Delft(CityAI实验室,运输与物流组,工程系统与服务部门,代尔夫特理工大学)
Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations
大语言模型还能自我解释吗?探讨量化对自我解释的影响
Qianli Wang, Nils Feldhus, Pepa Atanasova, Fedor Splitt, Simon Ostermann, Sebastian Möller, Vera Schmitt
机构
*
Quality and Usability Lab, Technische Universität Berlin(柏林技术大学质量与可用性实验室)
;
University of Copenhagen(哥本哈根大学)
;
Saarland Informatics Campus(萨尔州信息学校园)
;
German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)
;
Centre for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心)
;
BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院)
Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding
超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放
Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen
机构
*
University of Southern California(南加州大学)
;
Pohang University of Science and Technology (POSTECH)(浦项科技大学)
;
Tsinghua University(清华大学)
;
Carnegie Mellon University(卡内基梅隆大学)
CommentsPreprint. 450 Java files from 15 open-source systems; 1,350 model-pass outputs across three LLM configurations. The accompanying replication package will be made publicly available
CoMMa: Contribution-Aware Medical Multi-Agents for Decentralized Oncology Decision Support
从博弈论视角出发的贡献感知医疗多智能体:CoMMa
Yichen Wu, Kailong Fan, Sangjoon Park, Yuhan Liu, Zhiyi Shi, Sekeun Kim, Dania Daye, Hana Farzaneh, Xiang Li, Raul Uppot, Yujin Oh, Quanzheng Li
机构
*
Center for Advanced Medical Computing(先进医学计算中心)
;
Department of Radiology, Massachusetts General Hospital(放射科,马萨诸塞总医院)
;
Harvard Medical School(哈佛医学院)
;
Department of Radiation Oncology, Yonsei University College of Medicine(放射肿瘤科,延世大学医学院)
;
Yonsei University(延世大学)
;
Institute for Innovation in Digital Healthcare(数字医疗创新研究所)
;
Interventional Radiology Academic Medical Centers, Mass General Brigham(介入放射学学术医疗中心,马萨诸塞总医院 Brigham)
机构
*
University of Science(科学大学)
;
SKL of Processors, Institute of Computing Technology, CAS(处理器研究所,计算技术研究所,中国科学院)
;
University of Chinese Academy of Sciences(中国科学院大学)