Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation
保留语音到文本LLM能力的语音到语音生成
机构 * Microsoft(微软)
AI总结 提出PRIME-Speech框架,通过冻结骨干网络并仅训练语音生成模块,在保持语音到文本性能的同时实现高质量语音到语音转换,支持多轮对话。
大厂专区
保留语音到文本LLM能力的语音到语音生成
机构 * Microsoft(微软)
AI总结 提出PRIME-Speech框架,通过冻结骨干网络并仅训练语音生成模块,在保持语音到文本性能的同时实现高质量语音到语音转换,支持多轮对话。
实时无源目标检测
机构 * IIT Hyderabad(印度理工学院海得拉巴分校) ; Microsoft Research(微软研究院) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
AI总结 提出一种基于YOLOv10的实时无源目标检测方法,通过双头伪标签融合(DHF)和多尺度自适应表示多样化(MARD)损失,在保持实时性和轻量化的同时,显著提升域适应精度。
Comments Accepted to ECCV 2026
HealthAgentBench:面向挑战性前沿AI代理的统一真实医疗环境基准套件
机构 * Microsoft(微软)
AI总结 提出包含54个医疗任务的基准套件HealthAgentBench,评估AI代理在真实临床工作流中的端到端多步推理能力,最强代理Codex GPT-5.5仅达42%成功率。
PPT-Eval: 面向PowerPoint任务的计算机使用智能体基准
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft(微软) ; UMass Amherst(马萨诸塞大学阿默斯特分校) ; Google(谷歌) ; Snowflake
AI总结 提出PPT-Eval基准,包含120个PowerPoint任务,并设计基于评分标准的评估框架,通过部分评分和自然语言反馈衡量智能体表现,发现现有最强模型仅达45%成功率。
Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026
SeKV:面向长上下文LLM推理的分辨率自适应KV缓存与层次化语义记忆
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Microsoft Research(微软研究院)
AI总结 提出SeKV,一种分辨率自适应的语义KV缓存方法,通过熵引导的语义片段和GPU-CPU层次化存储,在不丢弃信息的情况下实现按需token级重建,平均性能提升5.9%,GPU内存减少53.3%。
一次重写就足够:来自生产技能描述优化的经验教训
机构 * Microsoft(微软)
AI总结 针对企业AI代理中技能描述重叠导致路由错误的问题,提出自动化优化管道,在9技能生产系统上达到与手动调优相当的F1值(79.2% vs 79.4%),并将每技能工程时间从120分钟降至3.8分钟。消融实验表明,仅用一次LLM重写即可获得大部分改进。
Comments 12 pages, 4 figures
XY模型的扩散预热采样实现规模化快速热化
机构 * Institute for Quantum Computing, University of Waterloo(滑铁卢大学量子计算研究所) ; Department of Physics and Astronomy, University of Waterloo(滑铁卢大学物理与天文学系) ; Perimeter Institute for Theoretical Physics(圆周理论物理研究所) ; Microsoft(微软)
AI总结 提出基于扩散模型的连续自旋系统采样方法,在XY模型上训练小尺寸温度条件扩散模型,生成大尺寸晶格精确样本,结合少量MCMC步骤将热化时间降低一个数量级。
Comments 17 pages, 10 figures
量化膨胀推理:低比特推理模型的隐藏成本——令牌膨胀
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft(微软) ; Anyscale ; Snowflake
AI总结 研究发现低比特后训练量化虽保持推理准确性,但会显著增加推理令牌使用量,导致端到端服务性能下降,并提出了CoT令牌膨胀比来量化该效应。