arXivDaily arXiv每日学术速递 周一至周五更新

行业趋势

共 259 篇

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2607.23511 cs · cs.CV

中科大&理想汽车提出MOJITO:端到端自动驾驶告别两级流水线

中国科学技术大学、理想汽车和新南威尔士大学的研究人员联合提出了MOJITO,一个统一的端到端自动驾驶框架。它去掉了主流方案里「感知先压缩、规划后解码」的两级接口,让动作、图像、激光雷达特征在块级模态联合注意力中同步更新。在NAVSIM v1

中国科学技术大学、理想汽车、新南威尔士大学等
封面
2607.24729 cs · cs.CV

华盛顿大学MicroZoom:一张照片合成350倍显微级十亿像素细节

华盛顿大学的研究团队提出了MicroZoom,一个面向显微尺度的十亿像素图像合成框架。给它一张普通照片和少量消费级显微镜特写做参考,它能合成一整幅无缝的十亿像素级图像,把微观纹理铺满整个画面,放大倍率最高到350倍。在21个对象的评估集上,

华盛顿大学等
封面
2607.23784 cs · cs.AI

华盛顿大学&微软让LLM写代码控制机器人:失败可定位、指令可纠错

华盛顿大学、微软研究院和MIT的研究团队提出了ARCHITECT,把机器人策略获取当成一个交互式程序合成任务:LLM编码智能体合成模块化的机器人程序,调用一套感知与控制工具来操作真实机械臂。在Franka Panda机器人上的8个真机任务、

华盛顿大学、微软研究院、MIT等
封面
2607.23806 cs · cs.AI

一个冻结的12B模型考了180/180满分:零token、位精确、永远如此

Corbenic AI发表了一份行业经验报告,描述了一套与主流路线相反的系统:模型保持冻结,一旁的持久记忆存储已验证的解法。问题族一旦被解决并通过不接触答案密钥的独立验证,该族每个新实例都由记忆直接应答——零生成token、位精确、确定性。

Corbenic AI等
封面
2607.23976 cs · cs.AI

Cornell研究:问题末尾加两个字,45个语言模型的答案翻转64个百分点

Cornell Tech的研究人员发表了一项针对语言模型谄媚性的大规模测量:在决策问题的末尾加一个两词确认标签——「X是更好的选择吗?」改成「X是更好的选择,对吧?」——就足以改变模型是否背书这个选择。跨45个模型,这个标签效应从+32%摆

Cornell Tech等
封面
2607.24560 cs · cs.AI

Snap&KAUST推出EgoPlay:第一人称视频「当X发生就自动Y」

Snap和KAUST的研究团队推出了EgoPlay,一个事件触发的第一人称视频编辑器。给它一段单目视频和一条「当X发生时,做Y」的指令,它自己判断事件X是否发生、何时发生,事件前的帧原样保留,编辑只作用于事件后的画面。该工作被SIGGRAP

Snap、KAUST等
封面
2607.23684 cs · cs.RO

北大&清华提出主动事件立体视觉:让深度感知追上超高速运动

北京大学、清华大学和鹏城实验室的研究人员联合提出了主动事件立体视觉,把双目事件相机和红外二维图案投射器组合成一套新的深度感知方案,用于高速运动下的稠密深度重建。团队搭建了双目事件相机原型,发布了真实与合成两个数据集,分别带21.5k个15H

北京大学、清华大学、鹏城实验室等
封面
2607.24591 cs · cs.CV

港中文&蚂蚁提出CameraAnything:像重新运镜一样重拍一段视频

蚂蚁集团、香港中文大学、清华大学等机构的研究团队提出了CameraAnything,第一个同时控制相机内参和外参的视频编辑统一框架。给定一段源视频,它可以按指定的机位轨迹、焦距和画幅重新「拍摄」这段内容,不需要裁切或外绘补全。用户研究里,C

蚂蚁集团、香港中文大学、清华大学等
封面
2607.23861 cs · cs.CV

ETH团队提出DynHair:给3D头像装上会随甩头自然摆动的头发

ETH苏黎世、马克斯·普朗克智能系统研究所、慕尼黑工业大学和微软的研究人员联合提出了DynHair,一种面向动态头发的头像建模方法。它从多视角视频出发,用显式发丝表示重建头发,再让发丝形变跟随头部的角速度、加速度和相对重力变化,生成能随甩头

ETH苏黎世、马克斯·普朗克智能系统研究所、慕尼黑工业大学、微软等
封面
2607.22101 cs · cs.CV

京东等用一个模型生成和修改图片文字,专门解决中文小字难题

图片生成模型可以画出复杂场景,却经常把招牌、海报和包装上的中文写错,字号一小更容易变形。京东、中山大学深圳校区、中国科学院大学、浙江大学团队提出InnoText,让同一个扩散Transformer同时负责视觉文字生成和编辑,并专门训练中文复

京东、中山大学深圳校区、中国科学院大学、浙江大学等
文章封面
2607.22531 cs · cs.CV

腾讯混元把图像理解和生成塞进同一组Token,ImageNet最高改善10.57 gFID

图像理解需要语义,图像生成需要纹理细节,统一多模态模型常用两套不同表示。腾讯混元、香港中文大学、香港城市大学、厦门大学团队提出Twins,把ViT语义特征与VAE潜变量拼成同一组连续视觉Token,在不增加序列长度的情况下同时服务理解、重建

腾讯混元、香港中文大学、香港城市大学、厦门大学等
文章封面
2607.22038 cs · cs.AI

华为诺亚等让AI芯片按任务跳过计算,端侧延迟降51%至59%

多任务模型执行左转、右转、直行或刹车时,通常会完整运行同一套骨干网络,即使部分计算与当前任务无关。香港科技大学、华为诺亚方舟实验室、香港科技大学(广州)团队把任务命令直接变成硬件执行掩码,在FPGA闭环驾驶实验中将端侧延迟降低51%至59%

香港科技大学、华为诺亚方舟实验室、香港科技大学(广州)等
文章封面
2607.22408 cs · cs.LG

剑桥等把三次月球任务数据合成一个模型,20万个月面切片可直接搜索和找矿

同一块月面可能同时有可见光、地形、温度、雷达和重力数据,但不同仪器的分辨率、覆盖与物理含义不一样。剑桥大学、德国航空航天中心、SPAIDER SPACE、帝国理工学院等团队提出LunarFM,把三次月球任务、六种仪器的18个输入通道对齐到一

剑桥大学、德国航空航天中心、SPAIDER SPACE、帝国理工学院等
文章封面
2607.22334 cs · cs.AI

快手等让Qwen、GLM和MiniMax跨Tokenizer教小模型,六项基准提升3.7至6.6分

Qwen、GLM和MiniMax可以各自当老师,但它们切分文字的Token规则不同,教师给出的概率分布不能直接交给同一个学生模型。中国科学院大学、快手KwaiKAT团队、浙江大学、香港中文大学提出BPM,把不同Tokenizer的输出搬到共

中国科学院大学、快手KwaiKAT团队、浙江大学、香港中文大学等
文章封面
2607.22530 cs · cs.RO

上海科技大学让机器人提前预演触觉,插接和剥离也能生成训练轨迹

机械臂把物体插进狭窄接口时,相机可能看不到接触点,真正决定成败的是压力、摩擦和细微位移。上海科技大学、InstAdapt团队提出ViTacWorld,让世界模型根据机器人动作同时预测未来画面和触觉反馈,再用生成轨迹扩充插接、剥离等任务的训练

上海科技大学、InstAdapt等
文章封面
2607.22302 cs · cs.CV

复旦、西湖等从脑信号重建动态人脸,数据集包含62856组高清视频样本

受试者在磁共振扫描仪里观看数字人面部视频,模型再根据fMRI信号重建身份外观、表情、头部姿态和连续运动。复旦大学、西湖大学、浙江大学、南洋理工大学团队提出fMRI2Face,并构建62856组脑信号与1920×1080视频配对样本。

复旦大学、西湖大学、浙江大学、南洋理工大学等
文章封面
2607.22434 cs · cs.AI

杜克大学让机器人学会玩影子:21自由度机械手能做手语和动物表演

一只机械手在灯前摆动,墙上的影子可以拼出手势字母,也能模仿鹿、孔雀、鸭子和狼的动作。杜克大学团队让21自由度灵巧手学习“自己的关节怎么改变影子”,再从目标图片或视频反推机械手动作,把影子变成机器人的表达媒介。

杜克大学等
文章封面
2607.21656 cs · cs.AI

Claude审查Codex通过率升至89.7%,反过来却把正确率改低了

同样是Claude Opus 4.7和Codex GPT-5.5配合写代码,谁先写、谁来审,结果并不对称。加州大学戴维斯分校、约翰斯·霍普金斯大学、加州州立大学长滩分校团队在116道LiveCodeBench中高难度题上测试发现:Claud

加州大学戴维斯分校、约翰斯·霍普金斯大学、加州州立大学长滩分校等
文章封面