arXivDaily arXiv每日学术速递 周一至周五更新

行业趋势

共 259 篇

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2607.28627 cs · cs.AI

UIUC、微软、DeepMind提出ReToken:一个可学习token让视觉检索大涨13个点

把上百张图片或一小时长的视频塞给视觉语言模型,答案明明就在某一帧里,模型却常常答不对。上下文越长,干扰画面越多,成绩掉得越厉害;而把整段视觉序列全量处理,显存又先撑不住,全量微调的成本更是高昂。伊利诺伊大学厄巴纳-香槟分校(UIUC)联合微

伊利诺伊大学厄巴纳-香槟分校、微软研究院、谷歌DeepMind等
文章封面
2607.28074 cs · cs.AI

微软造出会随模型一起进化的软件环境,9B智能体成功率从36.5%升到67.1%

会操作电脑的智能体,最缺的不是模型,而是能放手让它操作的软件。真实应用有登录门槛和真实用户,点错一步成本高昂,拿来训练又贵又慢、无法复现;可换成固定网页和截图当题库,模型又会很快把答案背下来。微软研究院(Microsoft Research

微软研究院等
文章封面
2607.28625 cs · cs.CV

南洋理工等把真实家庭变成录制棚,150小时多模态数据给具身智能当燃料

机器人要学会做家务,先得看懂人是怎么做家务的。可现有数据要么来自脚本化的实验室演示,要么是网络上没有动作真值的视频,规模与真实感很难兼得。南洋理工大学 S-Lab 与 ACE Robotics 给出的思路,是把真实公寓直接改造成录制棚:一套

南洋理工大学、ACE Robotics等
文章封面
2607.28287 cs · cs.AI

183关全部通关!亚马逊等团队提出Tycho,让AI边玩边写出游戏世界模型

面对一款规则完全陌生的网格益智游戏,大多数智能体的做法是"看一帧、走一步":靠反应式试错摸索规律,每走错一步都要在计分里留下代价。ARC-AGI-3把这类游戏做成了正式基准——64×64的彩色网格、没有文字说明、每一步操作都计入得分。德累斯

德累斯顿工业大学、亚马逊、莱布尼茨科学与技术信息中心等
文章封面
2607.28466 cs · cs.AI

复旦等用28万份肠镜报告训练AI,良恶性判断接近内镜医师水平

肠镜报告里写清了病灶的部位、大小和形态,却几乎不会注明这些描述对应检查中的哪一帧画面。复旦大学(附属中山医院)联合浙江大学、微软亚洲研究院、曼彻斯特大学等机构提出EndoCLIP,一个面向结肠镜检查的视觉语言基础模型:它直接复用医院档案库中

复旦大学、浙江大学、微软亚洲研究院、曼彻斯特大学等
文章封面
2607.28058 cs · cs.CV

快手可灵联手清华提出cIPO,不用人工标注让文生视频运动更真实

文生视频最容易露馅的地方,往往不是单帧画面,而是运动:手指突然融化、物体逐帧闪烁、转身时肢体结构错位。想靠偏好优化修正这些问题,传统做法要么请人逐条标注好坏视频,成本高昂;要么借助奖励模型打分,信号又常常不稳定。清华大学联合快手可灵团队(可

清华大学、快手可灵团队、中山大学等
文章封面
2607.28243 cs · cs.AI

上交、阿里等提出EgoGenesis,合成第一视角视频把双臂机器人成功率拉到70%

机器人学操作,最值钱的画面来自它"自己的眼睛":第一视角相机离夹爪和桌面最近,手与物体的接触关系看得最清楚。但这种数据恰恰最难收集——每条轨迹都要真机执行、人工重置、全程看护,失败还可能撞坏硬件。上海交通大学、阿里巴巴、天机芯智(Tianj

上海交通大学、阿里巴巴、天机芯智、香港科技大学等
文章封面
2607.27348 cs · cs.CV

二次元福音!清华等团队提出Bunraku,一张插图生成可编辑Live2D角色

一张精美的二次元立绘,画师交稿后往往就静止了:想让它眨眼、转头、换装,得靠资深画师手工拆上数周。清华大学、南洋理工大学与SparcAI的研究团队提出Bunraku,首次实现从单张插图端到端生成可编辑的Live2D角色——有序图层、变形网格、

清华大学、南洋理工大学、SparcAI等
文章封面
2607.27030 cs · cs.CR

不用前沿模型也能挖漏洞:HoF-Bench证明小模型组合更省更准

AISLE联合中欧技术研究所和马萨里克大学推出了HoF-Bench,一个基于真实AI发现漏洞的基准测试。基准包含8个代码库的95个CVE(通用漏洞披露),在严格协议下,最便宜的配置只需66美元就找到了70个CVE,而GPT-5.6 luna

AISLE、马萨里克大学等
封面
2607.26784 cs · cs.AI

浙大&美团等提出SkillRise:让AI智能体在跨任务中自动演化技能

浙江大学、新加坡国立大学、上海交通大学和美团联合提出了SkillRise,一个面向跨任务技能演化的统一强化学习框架。在ALFWorld、WebShop和ScienceWorld三个基准上,SkillRise在Pass@1指标上相比最强基线提

浙江大学、美团、上海交通大学等
封面
2607.26710 cs · cs.LG

北邮&国网电力&南洋理工提出PowerAtlas,用3B模型调度电力比GPT-5.5更好

AI工作负载的快速增长正把数据中心变成大规模、波动大但时空灵活的电网负荷。北京邮电大学、国网辽宁电力和南洋理工大学联合提出了PowerAtlas,一个用于电-计算协同调度的LLM智能体框架。团队与中国某省级电力公司合作构建了实验性电-计算网

北京邮电大学、国网辽宁电力、南洋理工大学等
封面
2607.26410 cs · cs.AI

NVIDIA提出Voice Memory:用「克制」策略降低语音识别错误率

英伟达(NVIDIA)提出了Voice Memory,一种仅推理的语音识别纠错方案。核心思路不是让模型更聪明,而是让它在"什么时候该改、什么时候不该改"上做得更好。在10个领域的测试中,Voice Memory将加权词错误率从8.36%降至

英伟达等
封面
2607.27194 cs · cs.CV

ETH&Google&微软发表VidMap,用时序结构突破视频三维重建极限

苏黎世联邦理工学院、谷歌和微软联合提出了VidMap,一个用于任意未标定视频度量三维重建的系统。在LaMAR数据集上,VidMap的W-AUC@full达到88.5,而基线方法ViPE为76.6。系统结合了SLAM的序列约束与SfM的全局优

苏黎世联邦理工学院、谷歌、微软等
封面
2607.26886 cs · cs.AI

CMU&亚马逊研究:Claude、GPT无图也编造诊断,66%的虚构还会同时承认「没图」

当被要求描述一张从未提供的医学图像时,前沿视觉语言模型不会弃权,而是会编造诊断结果。更关键的是,这些编造不是随机的——它高度依赖于患者的人口统计学特征。卡内基梅隆大学和亚马逊云科技的研究人员发现了这一现象,测试涉及Claude Opus-4

卡内基梅隆大学、亚马逊云科技等
封面
2607.26181 cs · cs.AI

腾讯&北大提出GoGoTB,AI自动完成芯片RTL验证,无需人工干预

功能验证占据了集成电路前端工程的主要工作量——一个漏到流片阶段的bug,就可能导致数百万美元的重新设计成本。腾讯、北京大学和西南交通大学联合提出了GoGoTB,一个智能体式RTL验证框架,在8个RTL设计上无需任何人工干预,实现了100%的

腾讯、北京大学、西南交通大学等
封面
2607.26860 cs · cs.LG

快手&港中文提出AMFD,单步生成超越多步FLUX.2 4B教师模型

快手科技影幻团队与香港中文大学MMLab联合提出AMFD(Amortized Fréchet Distance),一种用于视觉生成的分布匹配方法。在文本到图像生成任务上,AMFD训练的单步模型在GenEval基准上达到了0.846,超过了其

快手、香港中文大学等
封面
2607.22864 cs · cs.AI

NVIDIA&耶鲁发布Spatial-IQ:把空间智能拆成9个子能力逐项考试

NVIDIA研究院和耶鲁大学的研究人员发表了Spatial-IQ,一个分层诊断框架,把堆叠三维结构中的物体计数拆成9个感知与认知子任务,按人类空间认知的发育阶段组织,外加心理旋转作为补充探针。诊断结论直白:最好的模型Qwen在人类基线任务上

NVIDIA研究院、耶鲁大学等
封面