清华腾讯提出CoMem,128K上下文显存降至18.26GB
清华大学与腾讯提出长上下文记忆方法CoMem。在单张96GB英伟达H20上处理128K上下文时,一组不使用适配器的效率测试显示,峰值显存由完整上下文方案的89.36GB降至18.26GB,预填充时间由15.014秒缩短到1.917秒,加速7
从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。
清华大学与腾讯提出长上下文记忆方法CoMem。在单张96GB英伟达H20上处理128K上下文时,一组不使用适配器的效率测试显示,峰值显存由完整上下文方案的89.36GB降至18.26GB,预填充时间由15.014秒缩短到1.917秒,加速7
复旦大学、浙江大学、帝国理工学院和微软亚洲研究院等机构发布肠镜视觉语言模型EndoCLIP。团队从280476份常规肠镜记录中恢复出125756组病灶图文配对,用医生日常书写的报告替代昂贵的逐帧人工标注。
亚马逊Health AI团队用1200个模拟患者场景测试10款基础模型。表现最强的模型综合得分为4.25分,满分5分;分诊项目的最高通过率为88%,最弱模型只有32%。
研究人员重新检查了150条被公开基准判定为失败的电脑操作轨迹,发现其中15.3%的“FAIL”结论有问题:10.7%属于评测器漏判,4.7%是任务或环境本身已经损坏。
月之暗面发布多模态评测集PerceptionBench,用3000道短答案题测试16个前沿模型的基础视觉感知。最高准确率为59.7%,排名第二的Kimi K3为58.5%,没有模型达到60%。
阿里巴巴MAI-UI团队发布Qwen-UI-Agent技术报告,把手机、电脑、网页和DeepSearch任务放进同一套GUI智能体体系。论文报告的27B版本在MobileWorld-Real实机手机测试中取得92.2%的成功率,在Andro
加州理工学院研究团队把一套名为PAC-MAN的控制方法部署到宇树Unitree G1上。研究人员从正面向机器人手掷20次球,G1躲过19次,没有摔倒,实机成功率为95%。
让大模型避免声称自己“有意识”,是当前AI安全训练中的常见目标。Google Paradigms of Intelligence团队与多所高校的一项研究发现,这类约束可能同时压低模型对动物、自然物和技术物体的心智归因,并改变它在宗教、道德和
88款商业AI产品的系统提示词被放在同一套标准下审查。研究团队共检查3249条开发者指令,约40%的产品至少含有一条损害用户利益的要求,只有23.9%的产品覆盖全部八项用户保护维度。