arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2607.29172 具身智能与机器人

Gemini Robotics微调两轮,宇树G1三项任务最高成功率100%

加州大学伯克利分校、Google DeepMind和英伟达研究人员把Gemini Robotics On-Device部署到宇树Unitree G1上,只通过托管微调接口完成两轮闭环训练。三项实机操作的成功率分别升至100%、98%和96%

加州大学伯克利分校等
Gemini Robotics微调两轮,宇树G1三项任务最高成功率100%文章封面
2607.28627 大模型

微软与DeepMind团队只加一个Token,视觉检索提高13.4分

伊利诺伊大学厄巴纳-香槟分校、微软研究院和Google DeepMind研究人员提出ReToken,通过一个可学习的检索Token,从大量图片或长视频帧中筛选与问题相关的视觉信息。

伊利诺伊大学厄巴纳-香槟分校、微软研究院等
微软与DeepMind团队只加一个Token,视觉检索提高13.4分文章封面
2607.28263 AI基础设施

清华腾讯提出CoMem,128K上下文显存降至18.26GB

清华大学与腾讯提出长上下文记忆方法CoMem。在单张96GB英伟达H20上处理128K上下文时,一组不使用适配器的效率测试显示,峰值显存由完整上下文方案的89.36GB降至18.26GB,预填充时间由15.014秒缩短到1.917秒,加速7

清华大学、腾讯等
清华腾讯提出CoMem,128K上下文显存降至18.26GB文章封面
2607.28466 更多前沿

复旦浙大微软用28万份肠镜报告训练医疗AI

复旦大学、浙江大学、帝国理工学院和微软亚洲研究院等机构发布肠镜视觉语言模型EndoCLIP。团队从280476份常规肠镜记录中恢复出125756组病灶图文配对,用医生日常书写的报告替代昂贵的逐帧人工标注。

浙江大学、微软亚洲研究院等
复旦浙大微软用28万份肠镜报告训练医疗AI文章封面
2607.28367 Agent

AI智能体被判失败的案例中,15.3%可能判错了

研究人员重新检查了150条被公开基准判定为失败的电脑操作轨迹,发现其中15.3%的“FAIL”结论有问题:10.7%属于评测器漏判,4.7%是任务或环境本身已经损坏。

佐治亚理工学院、北卡罗来纳州立大学、北卡罗来纳大学教堂山分校、马凯特大学等
AI智能体被判失败的案例中,15.3%可能判错了文章封面
2607.28227 Agent

阿里发布Qwen-UI-Agent,手机实机任务成功率92.2%

阿里巴巴MAI-UI团队发布Qwen-UI-Agent技术报告,把手机、电脑、网页和DeepSearch任务放进同一套GUI智能体体系。论文报告的27B版本在MobileWorld-Real实机手机测试中取得92.2%的成功率,在Andro

阿里巴巴MAI-UI团队等
阿里发布Qwen-UI-Agent,手机实机任务成功率92.2%文章封面
2607.28623 具身智能与机器人

加州理工让宇树G1躲避球,20次投掷躲过19次

加州理工学院研究团队把一套名为PAC-MAN的控制方法部署到宇树Unitree G1上。研究人员从正面向机器人手掷20次球,G1躲过19次,没有摔倒,实机成功率为95%。

加州理工学院等
加州理工让宇树G1躲避球,20次投掷躲过19次文章封面
2607.28607 大模型

Google团队发现,压制AI意识自述会连带改变价值回答

让大模型避免声称自己“有意识”,是当前AI安全训练中的常见目标。Google Paradigms of Intelligence团队与多所高校的一项研究发现,这类约束可能同时压低模型对动物、自然物和技术物体的心智归因,并改变它在宗教、道德和

Google Paradigms of Intelligence团队等
Google团队发现,压制AI意识自述会连带改变价值回答文章封面
2607.28617 大模型

88款商业AI提示词被审计,四成产品出现用户利益冲突

88款商业AI产品的系统提示词被放在同一套标准下审查。研究团队共检查3249条开发者指令,约40%的产品至少含有一条损害用户利益的要求,只有23.9%的产品覆盖全部八项用户保护维度。

斯坦福大学、卡内基梅隆大学、麻省理工学院、牛津大学等
88款商业AI提示词被审计,四成产品出现用户利益冲突文章封面
2607.27296 更多前沿

雅马哈联手首尔大、KAIST发布SKY-Piano:11小时多模态钢琴演奏数据集

要让机器理解一次钢琴演奏,需要同时看见手怎么落键、身体怎么用力、琴键何时发声,还要能逐音对上乐谱。现有数据集却往往只占其中一两样:有的只有音频和MIDI,有的只有单视角视频,有的缺指法、缺身体动作。首尔国立大学、韩国科学技术院(KAIST)

韩国科学技术院、首尔国立大学、雅马哈等
文章封面
2607.28627 大模型

UIUC、微软、DeepMind提出ReToken:一个可学习token让视觉检索大涨13个点

把上百张图片或一小时长的视频塞给视觉语言模型,答案明明就在某一帧里,模型却常常答不对。上下文越长,干扰画面越多,成绩掉得越厉害;而把整段视觉序列全量处理,显存又先撑不住,全量微调的成本更是高昂。伊利诺伊大学厄巴纳-香槟分校(UIUC)联合微

伊利诺伊大学厄巴纳-香槟分校、微软研究院、谷歌DeepMind等
文章封面
2607.28625 具身智能与机器人

南洋理工等把真实家庭变成录制棚,150小时多模态数据给具身智能当燃料

机器人要学会做家务,先得看懂人是怎么做家务的。可现有数据要么来自脚本化的实验室演示,要么是网络上没有动作真值的视频,规模与真实感很难兼得。南洋理工大学 S-Lab 与 ACE Robotics 给出的思路,是把真实公寓直接改造成录制棚:一套

南洋理工大学、ACE Robotics等
文章封面
2607.28287 Agent

183关全部通关!亚马逊等团队提出Tycho,让AI边玩边写出游戏世界模型

面对一款规则完全陌生的网格益智游戏,大多数智能体的做法是"看一帧、走一步":靠反应式试错摸索规律,每走错一步都要在计分里留下代价。ARC-AGI-3把这类游戏做成了正式基准——64×64的彩色网格、没有文字说明、每一步操作都计入得分。德累斯

德累斯顿工业大学、亚马逊、莱布尼茨科学与技术信息中心等
文章封面
2607.28466 更多前沿

复旦等用28万份肠镜报告训练AI,良恶性判断接近内镜医师水平

肠镜报告里写清了病灶的部位、大小和形态,却几乎不会注明这些描述对应检查中的哪一帧画面。复旦大学(附属中山医院)联合浙江大学、微软亚洲研究院、曼彻斯特大学等机构提出EndoCLIP,一个面向结肠镜检查的视觉语言基础模型:它直接复用医院档案库中

复旦大学、浙江大学、微软亚洲研究院、曼彻斯特大学等
文章封面
2607.28058 视觉与生成

快手可灵联手清华提出cIPO,不用人工标注让文生视频运动更真实

文生视频最容易露馅的地方,往往不是单帧画面,而是运动:手指突然融化、物体逐帧闪烁、转身时肢体结构错位。想靠偏好优化修正这些问题,传统做法要么请人逐条标注好坏视频,成本高昂;要么借助奖励模型打分,信号又常常不稳定。清华大学联合快手可灵团队(可

清华大学、快手可灵团队、中山大学等
文章封面
2607.28243 具身智能与机器人

上交、阿里等提出EgoGenesis,合成第一视角视频把双臂机器人成功率拉到70%

机器人学操作,最值钱的画面来自它"自己的眼睛":第一视角相机离夹爪和桌面最近,手与物体的接触关系看得最清楚。但这种数据恰恰最难收集——每条轨迹都要真机执行、人工重置、全程看护,失败还可能撞坏硬件。上海交通大学、阿里巴巴、天机芯智(Tianj

上海交通大学、阿里巴巴、天机芯智、香港科技大学等
文章封面