arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

图像、视频、三维重建与视觉内容生成。

2607.28058 视觉与生成

快手可灵联手清华提出cIPO,不用人工标注让文生视频运动更真实

文生视频最容易露馅的地方,往往不是单帧画面,而是运动:手指突然融化、物体逐帧闪烁、转身时肢体结构错位。想靠偏好优化修正这些问题,传统做法要么请人逐条标注好坏视频,成本高昂;要么借助奖励模型打分,信号又常常不稳定。清华大学联合快手可灵团队(可

清华大学、快手可灵团队、中山大学等
文章封面
2607.28243 具身智能与机器人

上交、阿里等提出EgoGenesis,合成第一视角视频把双臂机器人成功率拉到70%

机器人学操作,最值钱的画面来自它"自己的眼睛":第一视角相机离夹爪和桌面最近,手与物体的接触关系看得最清楚。但这种数据恰恰最难收集——每条轨迹都要真机执行、人工重置、全程看护,失败还可能撞坏硬件。上海交通大学、阿里巴巴、天机芯智(Tianj

上海交通大学、阿里巴巴、天机芯智、香港科技大学等
文章封面
2607.27348 视觉与生成

二次元福音!清华等团队提出Bunraku,一张插图生成可编辑Live2D角色

一张精美的二次元立绘,画师交稿后往往就静止了:想让它眨眼、转头、换装,得靠资深画师手工拆上数周。清华大学、南洋理工大学与SparcAI的研究团队提出Bunraku,首次实现从单张插图端到端生成可编辑的Live2D角色——有序图层、变形网格、

清华大学、南洋理工大学、SparcAI等
文章封面
2607.27194 视觉与生成

ETH&Google&微软发表VidMap,用时序结构突破视频三维重建极限

苏黎世联邦理工学院、谷歌和微软联合提出了VidMap,一个用于任意未标定视频度量三维重建的系统。在LaMAR数据集上,VidMap的W-AUC@full达到88.5,而基线方法ViPE为76.6。系统结合了SLAM的序列约束与SfM的全局优

苏黎世联邦理工学院、谷歌、微软等
封面
2607.26860 视觉与生成

快手&港中文提出AMFD,单步生成超越多步FLUX.2 4B教师模型

快手科技影幻团队与香港中文大学MMLab联合提出AMFD(Amortized Fréchet Distance),一种用于视觉生成的分布匹配方法。在文本到图像生成任务上,AMFD训练的单步模型在GenEval基准上达到了0.846,超过了其

快手、香港中文大学等
封面
2607.22864 大模型

NVIDIA&耶鲁发布Spatial-IQ:把空间智能拆成9个子能力逐项考试

NVIDIA研究院和耶鲁大学的研究人员发表了Spatial-IQ,一个分层诊断框架,把堆叠三维结构中的物体计数拆成9个感知与认知子任务,按人类空间认知的发育阶段组织,外加心理旋转作为补充探针。诊断结论直白:最好的模型Qwen在人类基线任务上

NVIDIA研究院、耶鲁大学等
封面
2607.24729 视觉与生成

华盛顿大学MicroZoom:一张照片合成350倍显微级十亿像素细节

华盛顿大学的研究团队提出了MicroZoom,一个面向显微尺度的十亿像素图像合成框架。给它一张普通照片和少量消费级显微镜特写做参考,它能合成一整幅无缝的十亿像素级图像,把微观纹理铺满整个画面,放大倍率最高到350倍。在21个对象的评估集上,

华盛顿大学等
封面
2607.24560 视觉与生成

Snap&KAUST推出EgoPlay:第一人称视频「当X发生就自动Y」

Snap和KAUST的研究团队推出了EgoPlay,一个事件触发的第一人称视频编辑器。给它一段单目视频和一条「当X发生时,做Y」的指令,它自己判断事件X是否发生、何时发生,事件前的帧原样保留,编辑只作用于事件后的画面。该工作被SIGGRAP

Snap、KAUST等
封面
2607.23684 视觉与生成

北大&清华提出主动事件立体视觉:让深度感知追上超高速运动

北京大学、清华大学和鹏城实验室的研究人员联合提出了主动事件立体视觉,把双目事件相机和红外二维图案投射器组合成一套新的深度感知方案,用于高速运动下的稠密深度重建。团队搭建了双目事件相机原型,发布了真实与合成两个数据集,分别带21.5k个15H

北京大学、清华大学、鹏城实验室等
封面
2607.24591 视觉与生成

港中文&蚂蚁提出CameraAnything:像重新运镜一样重拍一段视频

蚂蚁集团、香港中文大学、清华大学等机构的研究团队提出了CameraAnything,第一个同时控制相机内参和外参的视频编辑统一框架。给定一段源视频,它可以按指定的机位轨迹、焦距和画幅重新「拍摄」这段内容,不需要裁切或外绘补全。用户研究里,C

蚂蚁集团、香港中文大学、清华大学等
封面
2607.23861 视觉与生成

ETH团队提出DynHair:给3D头像装上会随甩头自然摆动的头发

ETH苏黎世、马克斯·普朗克智能系统研究所、慕尼黑工业大学和微软的研究人员联合提出了DynHair,一种面向动态头发的头像建模方法。它从多视角视频出发,用显式发丝表示重建头发,再让发丝形变跟随头部的角速度、加速度和相对重力变化,生成能随甩头

ETH苏黎世、马克斯·普朗克智能系统研究所、慕尼黑工业大学、微软等
封面
2607.22101 视觉与生成

京东等用一个模型生成和修改图片文字,专门解决中文小字难题

图片生成模型可以画出复杂场景,却经常把招牌、海报和包装上的中文写错,字号一小更容易变形。京东、中山大学深圳校区、中国科学院大学、浙江大学团队提出InnoText,让同一个扩散Transformer同时负责视觉文字生成和编辑,并专门训练中文复

京东、中山大学深圳校区、中国科学院大学、浙江大学等
文章封面
2607.22535 具身智能与机器人

首尔大学先把机器人画进视频再预测未来,世界模型能适配未见过的机械臂

机器人世界模型通常直接接收关节或末端动作向量,再预测未来画面。换一台机械臂,向量含义和运动学关系都可能变化。首尔大学、RLWRLD团队提出RoFacto:先让控制器把命令变成名义轨迹,再把机器人几何渲染进相机画面,视频模型只学习物体如何响应

首尔大学、RLWRLD等
文章封面
2607.22531 大模型

腾讯混元把图像理解和生成塞进同一组Token,ImageNet最高改善10.57 gFID

图像理解需要语义,图像生成需要纹理细节,统一多模态模型常用两套不同表示。腾讯混元、香港中文大学、香港城市大学、厦门大学团队提出Twins,把ViT语义特征与VAE潜变量拼成同一组连续视觉Token,在不增加序列长度的情况下同时服务理解、重建

腾讯混元、香港中文大学、香港城市大学、厦门大学等
文章封面
2607.22302 更多前沿

复旦、西湖等从脑信号重建动态人脸,数据集包含62856组高清视频样本

受试者在磁共振扫描仪里观看数字人面部视频,模型再根据fMRI信号重建身份外观、表情、头部姿态和连续运动。复旦大学、西湖大学、浙江大学、南洋理工大学团队提出fMRI2Face,并构建62856组脑信号与1920×1080视频配对样本。

复旦大学、西湖大学、浙江大学、南洋理工大学等
文章封面
↑