arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

图像、视频、三维重建与视觉内容生成。

2609.20818 视觉与生成

水花飞溅也能3D定格!谷歌微软联合打造SplashSplat,高斯泼溅攻克流体重建

谷歌、苏黎世联邦理工学院与微软等机构联合推出流体动态三维重建框架SplashSplat,攻克了高速飞溅液体难以高保真建模的视觉难题。研究团队采用7台同步4K相机阵列采集真实流体数据,通过观测驱动的几何约束与动态三维高斯泼溅技术,精准还原液体

谷歌、苏黎世联邦理工学院、微软等
文章封面
2609.23153 AI基础设施

单卡加速265倍!北大清华阿里打造SparkDiffusion,5090秒级跑Wan2.1

北京大学、清华大学与阿里巴巴集团等机构联合推出视频扩散加速方案SparkDiffusion,攻克了长视频生成中的计算瓶颈。研究团队针对Wan2.1开源大模型设计动态稀疏路由与误差自校准机制,在保持画面完整的前提下剔除多达97%的冗余计算。单

北京大学、清华大学、阿里巴巴集团等
文章封面
2609.22788 视觉与生成

视频模型假装懂物理?清华微软ECCV揭秘:准确率差1%但思考逻辑全错

视频大模型在画面生成中展现了逼真的动态效果,但其是否真正理解客观物理世界的运动法则始终存在广泛争议。清华大学联合面壁智能与微软等机构在ECCV深入揭示了视频基础模型在物理因果推理中的表面化捷径缺陷。评测表明模型表面准确率虽仅与人类相差1%,

清华大学、面壁智能、微软等
文章封面
2609.24308 视觉与生成

世界模型一操作就露馅:31个系统接受交互可靠性体检

阿里巴巴、北京通用人工智能研究院、清华大学、南京大学等机构提出HappyWorld-Bench,把世界模型放进视频、空间和具身三条赛道。团队评测14个视频模型、9个空间系统和8个具身候选,重点检查交互后的状态保持与规则响应。

阿里巴巴、北京通用人工智能研究院、清华大学、南京大学等
文章封面
2609.24058 视觉与生成

一个OCR读懂229种语言,复旦腾讯把F1从65.71%拉到80.89%

复旦大学、腾讯微信视觉、华南理工大学提出ScriptMoE,用一个稀疏专家识别器覆盖10种文字体系、229种语言。它替换PP-OCRv5的识别模块后,在CC-OCR多语种任务上把F1从65.71%提高到80.89%,略高于最佳视觉语言模型的

复旦大学、腾讯微信视觉、华南理工大学等
文章封面
2609.24981 视觉与生成

视频一转镜头就变形?腾讯把3D几何塞进生成底层

香港科技大学、腾讯、香港大学、得克萨斯大学奥斯汀分校提出GAE,把3D几何直接放进生成模型的潜空间。同一份紧凑表示可解码画面、深度、相机和点云;在两个视频数据集上,FVD分别下降12.7%和23.1%。

香港科技大学、腾讯、香港大学、得克萨斯大学奥斯汀分校等
文章封面
2609.23863 具身智能与机器人

桌面一变机器人就懵?新模型把成功次数从4次拉到17次

西北大学、华盛顿大学、新加坡国立大学、微软提出Grounded Action Model,让机器人先把语言、点或框指定的目标变成带尺度的3D表示,再预测动作。在双臂YAM机器人视觉变化测试中,它20次成功17次,对照模型只成功4次。

西北大学、华盛顿大学、新加坡国立大学、微软等
文章封面
2609.24976 具身智能与机器人

机器人终于会“摸”了:伯克利触觉模型六项任务全胜

伊利诺伊大学厄巴纳-香槟分校、加州大学伯克利分校、西北大学提出DexTacWAM,让双手机器人同时预测视觉变化和十个指尖的接触变化。它在六项接触密集任务上全部取得最高分,平均70.6分,而最强基线为38.0分。

伊利诺伊大学厄巴纳-香槟分校、加州大学伯克利分校、西北大学等
文章封面
2609.23153 AI基础设施

单卡视频生成暴增265倍,北大清华阿里把50步压到3步

北京大学、清华大学、阿里巴巴等机构提出SparkDiffusion,把视频扩散的稠密注意力改成97%稀疏,并把50步生成压到3步。在Wan2.1 14B的720P测试中,单张RTX 5090端到端最高加速265倍,1.3B模型生成480P视

北京大学、清华大学、阿里巴巴等
文章封面
2609.21709 大模型

腾讯AI Lab&清华让大模型双向“说”手语,12名手语用户参与实测

清华大学、南洋理工大学、鹏城实验室与腾讯AI Lab提出SignGPT,用共享语言模型同时完成无gloss手语转文字和文字转手语。系统串起一轮手语对话,并邀请12名聋人美国手语使用者参与探索性评估,分别观察语义和动作体验。

清华大学、南洋理工大学、鹏城实验室、腾讯AI Lab等
文章封面
2609.21455 视觉与生成

阿里淘宝让视频模型补物理课:碰撞、多阶段运动一次适应

哈尔滨工业大学与阿里巴巴淘宝提出CompAdapt,让视频生成模型处理耦合运动、多阶段转换和多物体碰撞,并能用一个样例适应新的物理环境。目标不是只让单个物体移动得像,而是让连续事件彼此接得上。

哈尔滨工业大学、阿里巴巴淘宝等
文章封面
2609.22086 Agent

Adobe让设计智能体自己长技能,成功率从72.7%冲到99.3%

Adobe与布朗大学提出Designer-RSI:不更新模型权重,让设计智能体从自己完成和失败的任务中扩展外部技能库。五轮演化后,技能从76项增至139项;在Claude-Sonnet-4上的GenEval2执行成功率由72.7%升至99.

Adobe、布朗大学等
文章封面
2609.19927 视觉与生成

反光点乱成一团也能还原动作,浙大团队把中国功夫做成3D数据

浙江大学、西湖大学、复旦大学和南京大学团队提出DirtyMoCap,直接处理稀疏、无序、会丢失也会冒出异常点的光学动捕数据。单一模型可适配不同标记布局,自定义CUDA求解器相对标准PyTorch实现最高加速100倍,并把传统中国武术录制恢复

浙江大学、西湖大学、复旦大学、南京大学等
文章封面
2609.19872 视觉与生成

腾讯中科大让AI自己挑零件,8万种形状练出自动3D装配

中国科学技术大学、腾讯和香港科技大学团队提出PART:给它一个目标形状和零件库,模型会决定该选哪些部件、需要几个,再预测每块零件的六自由度姿态。团队用超过8万个形状训练,系统还能处理场景布局、图像目标和真实扫描输入,把找零件与拼形状合成一次

中国科学技术大学、腾讯、香港科技大学等
文章封面
2609.20818 视觉与生成

七台4K相机抓住一瞬水花,谷歌微软把真实飞溅重建成3D

谷歌、苏黎世联邦理工学院、微软和洛桑联邦理工学院团队提出SplashSplat,并建立真实飞溅液体基准:20个场景由七台同步4K相机以60fps拍摄。系统把短暂水流重建成可从新视角观看的动态3D,还能做时间插值和无需重新优化的风格迁移。

谷歌、苏黎世联邦理工学院、微软、洛桑联邦理工学院等
文章封面
2609.20034 视觉与生成

单张L20跑实时世界模型,Astronex用5B参数硬刚百亿模型

Astronex Robotics和南京信息工程大学推出Astronex-World 1.0:输入文字或首帧后,用户可以持续控制相机、动作与角色类型,还能在生成中途插入事件。因果版以832×480、24fps输出,在一张NVIDIA L20

Astronex Robotics、南京信息工程大学等
文章封面
2609.19817 具身智能与机器人

单臂机器人把衣服转开再折好,实机零样本成功率75.6%

南洋理工大学、香港大学和中国科学院团队提出RotateIt,让单臂机器人抓起衣服后绕固定点快速旋转,借惯性张力分开重叠布层。策略只在仿真中训练,面对八件没见过的真实衣物仍取得75.6%展开成功率,展开状态还能直接交给自动折叠程序。

南洋理工大学、香港大学、中国科学院等
文章封面
2609.18844 Agent

AI照着论文图做PPT,外观更像了,连接线却能全丢

深圳大学、中国科学院深圳先进技术研究院、中国科学院大学和中国铁塔推出ReFigBench,让多模态编码智能体把1000张真实arXiv概览图重建成可编辑PPT。实验覆盖10种模型与工作流配置:专用流程常让截图更像原图,却在所有配置中抹掉原生

深圳大学、中国科学院深圳先进技术研究院、中国科学院大学、中国铁塔等
文章封面
↑