阿里Wan-Animate-2把角色动画跑到24 FPS,还能用文字改机位
上传一张角色图和一段驱动视频,系统可以让新角色复现动作,并用文字改变输出镜头。阿里巴巴通义实验室公布的Wan-Animate-2还提供轻量版,在400×720分辨率、4张NVIDIA H100上达到24 FPS。
上传一张角色图和一段驱动视频,系统可以让新角色复现动作,并用文字改变输出镜头。阿里巴巴通义实验室公布的Wan-Animate-2还提供轻量版,在400×720分辨率、4张NVIDIA H100上达到24 FPS。
韩国科学技术院、中国科学技术大学和微软亚洲研究院提出一种稀疏dToF深度补全模型。它只用合成数据训练,却在六个数据集和三款真实直接飞行时间传感器上做零样本测试,把低分辨率、带噪的测距点补成密集度量深度图。
中国科学技术大学和京东探索研究院提出OmniVR,用一个22B参数音视频生成模型同时修复历史影片。输入里的模糊、噪点、闪烁、低曝光、嘶声、削波和声音缺失,会在统一扩散过程中处理,而不是先修画面、再接独立音频工具。
阿里巴巴、浙江大学、北京航空航天大学和字节跳动团队发布MetaVideoAgent,让长视频问答智能体根据目标视频类型自动修改自己的处理流程。四轮进化后,八类视频的宏平均准确率从38.44%升到51.47%。
清华大学、南京大学、快手可灵团队、上海科技大学和香港科技大学提出ContextMaster。它把文字生成、参考图生成和视频编辑放进同一个多轮工作流,每次接受的新镜头都会加入历史,供后续镜头继续使用。
伊利诺伊大学厄巴纳-香槟分校、Google DeepMind和OpenAI研究者提出CoCo-IR,把“拿一张参考图加一句修改要求”的图像检索,扩展为可连续追问的多轮搜索。用户可以先换颜色,再改背景,随后引用前面某一轮的视角或物体继续筛选。
长视频编辑智能体要连续做素材选择、剪切、排序、字幕和导出,最终成片出炉后才得到好坏评价。阿里巴巴、中国科学技术大学等机构提出GRPB,把同一任务多版成片的相对排名,重新分配给中间编辑片段,用于训练9B参数的Crayotter。
论文公开页面未披露作者机构。Video-DeepResearch团队研究的任务要求模型先在连续画面里找到人物或物体,再去网页补充外部知识;团队发现,现有智能体常跳过视觉工具直接搜索文字,或凭模型记忆作答。新系统因此分阶段开放工具,强制先完成
网页里连续出现几张相同卡片,其中一张明显更宽。多模态模型先算出它接近120%,最后却把代码填成和其他卡片一样的100%。一项由威廉与玛丽学院团队完成的研究,把这种错误称为“视觉模式补全偏差”。
腾讯混元公布Hunyuan3D-Buffalo 1.0,把3D问答与定位、文本生成3D、指令编辑3D和指定部件生成放进同一套架构。训练语料总规模为8700万条,包括2500万理解样本、5000万文本到3D配对和1200万编辑配对。
中国科学院自动化研究所、香港中文大学、清华大学等团队发布WorldExam,用1474个案例评测20个可控视频与世界模型。没有一款模型同时覆盖大量任务并保持稳定高表现,画质好、指令完成度高,也不保证场景会作出合理反应。
南洋理工大学、剑桥大学、新加坡管理大学和CentraleSupélec团队发布CultureVidBench,用1000条提示测试7款文本生成视频模型。结果显示,模型能生成语义相符、画质不错的视频,却常把服饰、文字、仪式步骤和声音线索做错。
美团与清华大学团队训练了150多个视觉语言模型,覆盖34个大语言模型和7个模型家族,尝试在多模态训练开始前预测哪一个LLM更适合做视觉底座。
阿里巴巴通义千问、中国人民大学、上海科技大学、北京通用人工智能研究院和北京航空航天大学团队发布Ego2Robot,把人类佩戴相机拍下的第一视角操作视频转换为机器人训练数据。整套数据达到18561小时,覆盖15种机器人形态。
俄罗斯Sirius教育中心和高等经济大学团队用186527张电商评价图片训练AI生成检测器。产品完全隔离的测试集上,最强模型PR-AUC达到0.9999;把合成图重新编码成真实图片常见的格式后,成绩跌到0.7254。
香港科技大学、浙江大学、香港中文大学和斯坦福大学团队发布FlexComposer。用户提供背景视频、前景图片或视频,再画一条移动轨迹,模型会把素材放进场景,同时生成遮挡、光照、阴影和反射变化。
伊利诺伊大学厄巴纳-香槟分校、微软研究院和Google DeepMind研究人员提出ReToken,通过一个可学习的检索Token,从大量图片或长视频帧中筛选与问题相关的视觉信息。
月之暗面发布多模态评测集PerceptionBench,用3000道短答案题测试16个前沿模型的基础视觉感知。最高准确率为59.7%,排名第二的Kimi K3为58.5%,没有模型达到60%。
把上百张图片或一小时长的视频塞给视觉语言模型,答案明明就在某一帧里,模型却常常答不对。上下文越长,干扰画面越多,成绩掉得越厉害;而把整段视觉序列全量处理,显存又先撑不住,全量微调的成本更是高昂。伊利诺伊大学厄巴纳-香槟分校(UIUC)联合微
视频生成正在变成一道长序列题:一段高分辨率视频摊成 token 后动辄十几万,扩散 Transformer 里的全注意力显存随帧数平方膨胀,训练账单越来越贵。Adobe Research 提出 Chimera,一套混合视觉扩散 Transf