arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harvard University(哈佛大学)

2026-08-25 至 2026-08-25 共收录 3
2608.22854 2026-08-25 cs.LG 新提交

Thinking at the Right Size: Amortized Distillation Across Post-Trained LLMs

合适规模的思考:跨后训练大语言模型的摊销蒸馏

Yan Zhou, Sara Kangaslahti, Jonathan Geuter, Nihal V. Nayak, Marco Fumero, Francesco Locatello, David Alvarez-Melis

机构 * Harvard University(哈佛大学) IST Austria(奥地利科学技术研究所)

AI总结 该研究提出ADAPT框架,可单次蒸馏生成跨后训练大语言模型的多规模多变体模型,实现平滑规模插值与自适应规模选择,优化长文本推理的计算-准确率权衡。

Comments 8 pages, 6 figures. EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22132 2026-08-25 cs.CL cs.AI cs.CE 新提交

SSE-Bio: A Structured Self-Evolving Agent with Agentic Retrieval Policy for Multi-Hop Biomedical Reasoning

SSE-Bio:面向多跳生物医学推理的、具备智能体式检索策略的结构化自进化智能体

Zhaohan Meng, Zaiqiao Meng, Siwei Liu, Hao Xu, Ke Yuan, Iadh Ounis

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算科学学院) Brigham and Women’s Hospital, Harvard Medical School, Harvard University(哈佛大学医学院附属布莱根妇女医院) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) School of Natural and Computing Science, University of Aberdeen(阿伯丁大学自然与计算科学学院) School of Cancer Sciences, University of Glasgow(格拉斯哥大学癌症科学学院) Cancer Research UK Scotland Institute(英国癌症研究苏格兰研究所)

AI总结 本研究针对生物医学多跳问答的指令漂移问题,提出SSE-Bio结构化自进化智能体,通过代理策略选择性检索、细粒度模板编辑及组相对策略优化,在三个基准上实现优于现有基线的性能,BioHopR上提升6.56绝对点。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21554 2026-08-25 cs.RO cs.LG cs.MA 新提交

Model-Based Reinforcement Learning for Heterogeneous Multi-Robot Task Assignment Under Distribution Shifts

分布偏移下异构多机器人任务分配的模型强化学习方法

Daniel Garces, Sara Castro, Adrian Haimovich, Byron Crowe, Stephanie Gil

机构 * John A. Paulson School Of Engineering And Applied Sciences, Harvard University(哈佛大学约翰·A·保尔森工程与应用科学学院) Harvard Medical School(哈佛医学院) Beth Israel Deaconess Medical Center(贝斯以色列女执事医疗中心) Stanford University School of Medicine(斯坦福大学医学院)

AI总结 本文提出一种预测感知自适应滚动框架,用于分布偏移下异构多机器人任务分配,在医院护理任务案例中,该方法较多种基线缩短了等待时间,提升了服务覆盖与尾部延迟性能。

Comments 34 pages, 14 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏