Gemini Robotics微调两轮,宇树G1三项任务最高成功率100%
加州大学伯克利分校、Google DeepMind和英伟达研究人员把Gemini Robotics On-Device部署到宇树Unitree G1上,只通过托管微调接口完成两轮闭环训练。三项实机操作的成功率分别升至100%、98%和96%
加州大学伯克利分校、Google DeepMind和英伟达研究人员把Gemini Robotics On-Device部署到宇树Unitree G1上,只通过托管微调接口完成两轮闭环训练。三项实机操作的成功率分别升至100%、98%和96%
伊利诺伊大学厄巴纳-香槟分校、微软研究院和Google DeepMind研究人员提出ReToken,通过一个可学习的检索Token,从大量图片或长视频帧中筛选与问题相关的视觉信息。
清华大学与腾讯提出长上下文记忆方法CoMem。在单张96GB英伟达H20上处理128K上下文时,一组不使用适配器的效率测试显示,峰值显存由完整上下文方案的89.36GB降至18.26GB,预填充时间由15.014秒缩短到1.917秒,加速7
复旦大学、浙江大学、帝国理工学院和微软亚洲研究院等机构发布肠镜视觉语言模型EndoCLIP。团队从280476份常规肠镜记录中恢复出125756组病灶图文配对,用医生日常书写的报告替代昂贵的逐帧人工标注。
亚马逊Health AI团队用1200个模拟患者场景测试10款基础模型。表现最强的模型综合得分为4.25分,满分5分;分诊项目的最高通过率为88%,最弱模型只有32%。
研究人员重新检查了150条被公开基准判定为失败的电脑操作轨迹,发现其中15.3%的“FAIL”结论有问题:10.7%属于评测器漏判,4.7%是任务或环境本身已经损坏。
月之暗面发布多模态评测集PerceptionBench,用3000道短答案题测试16个前沿模型的基础视觉感知。最高准确率为59.7%,排名第二的Kimi K3为58.5%,没有模型达到60%。
阿里巴巴MAI-UI团队发布Qwen-UI-Agent技术报告,把手机、电脑、网页和DeepSearch任务放进同一套GUI智能体体系。论文报告的27B版本在MobileWorld-Real实机手机测试中取得92.2%的成功率,在Andro
加州理工学院研究团队把一套名为PAC-MAN的控制方法部署到宇树Unitree G1上。研究人员从正面向机器人手掷20次球,G1躲过19次,没有摔倒,实机成功率为95%。
让大模型避免声称自己“有意识”,是当前AI安全训练中的常见目标。Google Paradigms of Intelligence团队与多所高校的一项研究发现,这类约束可能同时压低模型对动物、自然物和技术物体的心智归因,并改变它在宗教、道德和
88款商业AI产品的系统提示词被放在同一套标准下审查。研究团队共检查3249条开发者指令,约40%的产品至少含有一条损害用户利益的要求,只有23.9%的产品覆盖全部八项用户保护维度。
要让机器理解一次钢琴演奏,需要同时看见手怎么落键、身体怎么用力、琴键何时发声,还要能逐音对上乐谱。现有数据集却往往只占其中一两样:有的只有音频和MIDI,有的只有单视角视频,有的缺指法、缺身体动作。首尔国立大学、韩国科学技术院(KAIST)
把上百张图片或一小时长的视频塞给视觉语言模型,答案明明就在某一帧里,模型却常常答不对。上下文越长,干扰画面越多,成绩掉得越厉害;而把整段视觉序列全量处理,显存又先撑不住,全量微调的成本更是高昂。伊利诺伊大学厄巴纳-香槟分校(UIUC)联合微
视频生成正在变成一道长序列题:一段高分辨率视频摊成 token 后动辄十几万,扩散 Transformer 里的全注意力显存随帧数平方膨胀,训练账单越来越贵。Adobe Research 提出 Chimera,一套混合视觉扩散 Transf
会操作电脑的智能体,最缺的不是模型,而是能放手让它操作的软件。真实应用有登录门槛和真实用户,点错一步成本高昂,拿来训练又贵又慢、无法复现;可换成固定网页和截图当题库,模型又会很快把答案背下来。微软研究院(Microsoft Research
机器人要学会做家务,先得看懂人是怎么做家务的。可现有数据要么来自脚本化的实验室演示,要么是网络上没有动作真值的视频,规模与真实感很难兼得。南洋理工大学 S-Lab 与 ACE Robotics 给出的思路,是把真实公寓直接改造成录制棚:一套
面对一款规则完全陌生的网格益智游戏,大多数智能体的做法是"看一帧、走一步":靠反应式试错摸索规律,每走错一步都要在计分里留下代价。ARC-AGI-3把这类游戏做成了正式基准——64×64的彩色网格、没有文字说明、每一步操作都计入得分。德累斯
肠镜报告里写清了病灶的部位、大小和形态,却几乎不会注明这些描述对应检查中的哪一帧画面。复旦大学(附属中山医院)联合浙江大学、微软亚洲研究院、曼彻斯特大学等机构提出EndoCLIP,一个面向结肠镜检查的视觉语言基础模型:它直接复用医院档案库中
文生视频最容易露馅的地方,往往不是单帧画面,而是运动:手指突然融化、物体逐帧闪烁、转身时肢体结构错位。想靠偏好优化修正这些问题,传统做法要么请人逐条标注好坏视频,成本高昂;要么借助奖励模型打分,信号又常常不稳定。清华大学联合快手可灵团队(可
机器人学操作,最值钱的画面来自它"自己的眼睛":第一视角相机离夹爪和桌面最近,手与物体的接触关系看得最清楚。但这种数据恰恰最难收集——每条轨迹都要真机执行、人工重置、全程看护,失败还可能撞坏硬件。上海交通大学、阿里巴巴、天机芯智(Tianj