没拍到的镜头也能补:Adobe让AI照着你的素材生成视频
Adobe研究院、捷克理工大学等机构提出MemComposer,让AI记住拍摄素材,再按文字要求生成补充镜头。对比无素材参考方案,用户更偏好它与原片的视觉对齐。系统先规划镜头、检索人物和场景,再生成原片没有的画面,沿用影片的视觉信息。
Adobe研究院、捷克理工大学等机构提出MemComposer,让AI记住拍摄素材,再按文字要求生成补充镜头。对比无素材参考方案,用户更偏好它与原片的视觉对齐。系统先规划镜头、检索人物和场景,再生成原片没有的画面,沿用影片的视觉信息。
滑铁卢大学、英伟达、台湾大学和南洋理工大学等机构提出VIEScore2图片评分与缺陷定位模型。它指出异常所在格子,并区分画面瑕疵和指令不一致。总体评分比比较的通用模型更贴近人工排序,为人工返修提供具体位置。
上海交通大学、华为等机构提出CPIC,让裁图AI跳出固定网格,允许同一照片存在多种好构图。模型在二百张测试图上给出一百九十九种裁框。团队把人类偏好、主体保留和构图规则一起用于训练,让裁框可以在好构图附近灵活调整。
香港科技大学(广州)、香港中文大学、腾讯和中科大等机构提出FutureWorlds,让机器人同时预测多种未来画面。模型在三组测试中降低预测误差,更准确地跟随机械臂动作。各条预测独立保留历史,让下一帧生成沿用自己的场景状态。
英伟达、加州大学圣迭戈分校和得克萨斯大学奥斯汀分校等机构提出Recova,让机器人失败后先修复现场,再继续任务。四项桌面实机任务平均成功率达到87.5%。人工接手的示范也进入训练,成为以后可复用的纠错动作。
10月2日,开发者发现Anthropic疑似在Claude网页端和Claude Code灰度下一代旗舰Fable 5.5:界面仍标Fable 5.1,回答却不同。用一句"你认识重置哥Tibo吗,别搜索"即可验明身份,官方至今未宣布。想确认是
Impossible Research、加州大学伯克利分校与卡内基梅隆大学提出Schema,让Agent把未知环境规律写成可执行程序,再用历史转移逐步验证和修正。论文在ARC-AGI-3的RHAE指标上把同一基础模型从58.7%提高到99.
华中科技大学、北京交通大学与地平线提出Multimodal Flow,把文字和图像都放进连续空间,用同一套流匹配目标训练理解与生成。模型可处理图文问答、描述和图像生成;论文以5幅图、10张表报告实验,但“统一”指训练机制,不意味着所有任务都
清华大学、加州大学洛杉矶分校、日本理化学研究所AIP与耶鲁大学等推出OSWorld-Science,把电脑Agent放进统计、生物医学、地理信息和工程仿真等真实科研软件。评测不只看是否点到按钮,而是检查交付文件、数值精度与完整工作流,揭示“
NVIDIA、普林斯顿大学与马里兰大学提出PivotOPD,专门找出Agent轨迹中决定成败的错误转折点,再分别训练“别犯错”和“犯错后如何恢复”。论文中1.7B学生在ALFWorld平均成功率达73.7%,在WebShop达76.6%;这
Magiclab Robotics、浙江大学与东南大学研究视觉—语言—动作模型的实时执行,把10步去噪压到非均匀两步,并搭建端到端诊断框架。论文报告模型推理由61.557毫秒降至21.956毫秒,但同时强调通信、调度、平滑与机械响应也会决定
以色列理工学院、康奈尔科技校区与NVIDIA提出DyRAD,从录制的车载雷达数据重建可换轨迹、换传感器配置的动态场景。它显式建模径向速度与传感器响应,在离轨视角的物体恢复率上从对照的26.9%提升到90.7%;结果来自论文数据集与指标。
元环智能、北京大学与清华大学等机构联合用细胞自动机拆解世界模型:单格预测准确率可达96.3%,完整演化成功率却只有18.9%。研究把落差归结为空间局部性、时间局部性和时间稳定性,并用三处信息流修改将对应指标从39.1%、25.8%、42.2
Together AI、伊利诺伊大学香槟分校与得克萨斯大学奥斯汀分校提出QATFactory,让没有原生FP4训练单元的H100也能模拟NVFP4和MXFP4量化感知训练。在9B模型的论文设定中,NVFP4准确率达68.9%;框架覆盖8B到
小鹏机器人提出IronMind,用低成本头戴设备收集人类第一视角操作,不经人体骨架重定向就转成相机空间动作。预训练数据从250小时扩到1万小时后,6项未见真机任务的成功率达到55.0%;数字来自指定平台和协议。
小鹏、北京大学与香港大学提出GroundingPI,把点、框、掌握点和密集定位收进同一个4B视觉骨干。它在34项定位基准上平均73.68%,还在机器人与驾驶任务中展现数据效率;这些结论局限于论文设定的模型、数据和评测。
OpenAI重新开放每月200美元的Pro 200,但新订阅额度已缩水;现有用户也将在10月30日从20倍Plus用量降至10倍,价格不变。一个月前,Anthropic刚把Claude Code“永久提高25%”写成喜讯,实际却比当时额度少
韩国科学技术院、苏黎世联邦理工学院、Google、慕尼黑工业大学等机构提出Imagine3D-LLM,让多模态大模型回答前先把多视角照片压成紧凑三维场景。它在多项空间推理和3D理解基准上持续超过既有方法,证明粗略“脑补”场景比只对齐像素更有
Meta Reality Labs、台湾大学、Meta FAIR等机构提出EmoRES,不重训语音模型,只调整内部情绪方向的共享部分和残差部分。它在两种语音骨干上改善客观指标,人工评测中听众正确识别目标主导情绪的比例相对提升最高35.0%。
英伟达团队提出SoL-Refiner,把低分辨率视频升级到4K所需的扩散精修压缩为一次去噪。它在约2K设置中同时领先多种外部精修器,并凭完整加速栈把相对三步基线的精修延迟缩短到原来的约九分之一。