视频生成自带分轨!谷歌等把人声和乐器声分别交出来
谷歌、特拉维夫大学等机构提出SepGen,生成视频时同时输出混合音频与两个独立声轨。示例包括演唱与乐器、人声对话等场景。同一模型还可以接收已有视频和音频进行分离,让画面中的发声对象参与判断声音应该归到哪一轨。
谷歌、特拉维夫大学等机构提出SepGen,生成视频时同时输出混合音频与两个独立声轨。示例包括演唱与乐器、人声对话等场景。同一模型还可以接收已有视频和音频进行分离,让画面中的发声对象参与判断声音应该归到哪一轨。
卡内基梅隆大学、Meta联合提出SLVR,让AI先定位图片里的目标,再挑证据、组织答案,推理时不必写出长段过程。在300项带错误描述的诊断测试中,正确率从41.7%升至70.7%。模型可以回到画面核对颜色、数量和空间关系,减少跟着文字猜答案
Anthropic发布Haiku 5.5,在提示词不超过10万Token时,输入、输出单价均比上一代低90%,性能超越DeepSeek V4.1Flash和GLM-5.3-Flash两大性价比模型,成为新的性价比担当。并向Max和Team用
斯坦福大学、佐治亚理工学院、卡内基梅隆大学提出Sherpa,让AI老师根据模拟学生的学习效果调整讲解方式。在七类模拟学生上,教学后的平均答题率从48.6%提高到69.0%;教学评测分从52.5%升到79.2%。它把学生能否进步变成训练信号,
高通AI研究院、密歇根大学等机构提出DyRA,在压缩矩阵计算之后,按当前输入补偿输出误差。DINOv3实测端到端GPU加速1.5倍,相比只压缩权重的对照,精度退化减少超过3倍。视觉、语音和语言实验显示,省计算时检查实际输出,比只追求权重接近
斯坦福大学计算机科学系、Food Intelligence Lab、NECTAR、多伦多大学化学工程系等机构提出TasteBench,汇集超过2.1万次人类评价,检验AI预测植物食品与目标食品的口味相似度。同组比较中,最佳模型准确率66.1
微软、香港理工大学、加州大学戴维斯分校等机构提出ProAR,让持续生成视频的模型同时预想最终画面和下一步状态。VBVR十项任务中,平均成绩从0.663升到0.801;训练2500步时就超过训练10000步的标准基线。视频生成开始按目标和规则
10月2日,开发者发现Anthropic疑似在Claude网页端和Claude Code灰度下一代旗舰Fable 5.5:界面仍标Fable 5.1,回答却不同。用一句"你认识重置哥Tibo吗,别搜索"即可验明身份,官方至今未宣布。想确认是
Impossible Research、加州大学伯克利分校与卡内基梅隆大学提出Schema,让Agent把未知环境规律写成可执行程序,再用历史转移逐步验证和修正。论文在ARC-AGI-3的RHAE指标上把同一基础模型从58.7%提高到99.
华中科技大学、北京交通大学与地平线提出Multimodal Flow,把文字和图像都放进连续空间,用同一套流匹配目标训练理解与生成。模型可处理图文问答、描述和图像生成;论文以5幅图、10张表报告实验,但“统一”指训练机制,不意味着所有任务都
NVIDIA、普林斯顿大学与马里兰大学提出PivotOPD,专门找出Agent轨迹中决定成败的错误转折点,再分别训练“别犯错”和“犯错后如何恢复”。论文中1.7B学生在ALFWorld平均成功率达73.7%,在WebShop达76.6%;这
元环智能、北京大学与清华大学等机构联合用细胞自动机拆解世界模型:单格预测准确率可达96.3%,完整演化成功率却只有18.9%。研究把落差归结为空间局部性、时间局部性和时间稳定性,并用三处信息流修改将对应指标从39.1%、25.8%、42.2
Together AI、伊利诺伊大学香槟分校与得克萨斯大学奥斯汀分校提出QATFactory,让没有原生FP4训练单元的H100也能模拟NVFP4和MXFP4量化感知训练。在9B模型的论文设定中,NVFP4准确率达68.9%;框架覆盖8B到
小鹏机器人提出IronMind,用低成本头戴设备收集人类第一视角操作,不经人体骨架重定向就转成相机空间动作。预训练数据从250小时扩到1万小时后,6项未见真机任务的成功率达到55.0%;数字来自指定平台和协议。
小鹏、北京大学与香港大学提出GroundingPI,把点、框、掌握点和密集定位收进同一个4B视觉骨干。它在34项定位基准上平均73.68%,还在机器人与驾驶任务中展现数据效率;这些结论局限于论文设定的模型、数据和评测。
OpenAI重新开放每月200美元的Pro 200,但新订阅额度已缩水;现有用户也将在10月30日从20倍Plus用量降至10倍,价格不变。一个月前,Anthropic刚把Claude Code“永久提高25%”写成喜讯,实际却比当时额度少
韩国科学技术院、苏黎世联邦理工学院、Google、慕尼黑工业大学等机构提出Imagine3D-LLM,让多模态大模型回答前先把多视角照片压成紧凑三维场景。它在多项空间推理和3D理解基准上持续超过既有方法,证明粗略“脑补”场景比只对齐像素更有
Meta Reality Labs、台湾大学、Meta FAIR等机构提出EmoRES,不重训语音模型,只调整内部情绪方向的共享部分和残差部分。它在两种语音骨干上改善客观指标,人工评测中听众正确识别目标主导情绪的比例相对提升最高35.0%。
哈佛大学、新加坡国立大学、麻省理工学院、MIT-IBM Watson AI Lab等机构提出Honeycomb,用六张固定尺寸的空间与时空平面保存长视频场景。实验表明它在记忆占用不随生成时长增长的同时,仍能在WorldScore与RealE
Google Research、南加州大学、Google DeepMind、哈佛大学等机构联合提出TabFM-Auto,让Agent围绕冻结的表格基础模型自动修改数据流水线。它在TabArena的51个数据集上由五种配置包揽总榜前五,最佳方