DeepSeek新模型把KV缓存压到1/4,百万Token智能体更省内存
DeepSeek推出多模态模型DeepSeek-V4.1-Flash,主干参数为552B,最长支持100万Token上下文。它把全局KV缓存降到每Token 890字节,约为DeepSeek-V4-Flash的1/4;持久缓存约降到1/8,
DeepSeek推出多模态模型DeepSeek-V4.1-Flash,主干参数为552B,最长支持100万Token上下文。它把全局KV缓存降到每Token 890字节,约为DeepSeek-V4-Flash的1/4;持久缓存约降到1/8,
OPPO AI中心推出HearInContext,用3764个中英文语义样例测试语音识别能否根据对话上下文区分同音词。微调Qwen3-ASR-1.7B后,中文和英文隐式上下文目标词召回分别提高11.0和11.5个百分点,而AISHELL-1
复旦大学、新加坡国立大学和腾讯团队提出一套MiniMax-H3跨模态物理推理评测,包含517个样例。模型要把文字、图像、声音和前缀视频中的不完整线索拼在一起,最终总体成功率41.97%;其中视频决策推理最高为56.00%,音频消歧最低仅27
Google Research、Google DeepMind、加州大学洛杉矶分校和纽约大学分析2518条长任务智能体轨迹,人工标注6967个错误并归为78类。六个前沿模型担任评判器时,表现最好的也不能在三分之一以上的轨迹中正确定位首个错误
SeedLeap.ai推出5B参数世界模型Zing-0.5,让用户同时用键盘动作和在线文字指令改变正在生成的画面。论文报告它以832×480分辨率达到24 FPS,服务器租赁成本估算约每流分钟0.009美元;不过长期状态保持和动作后果仍有限
腾讯、清华大学、中国科学院大学提出Video-HolmesV2,专门检查长视频AI能否把画面与声音放进同一条证据链。模型不只要选对答案,还要给出准确的视听时间位置,靠剧情常识猜中也会暴露。在这套新测试中,强专有模型准确率仍低于60%;团队还
宾夕法尼亚大学、Snap、阿卜杜拉国王科技大学提出PhysStream,让视频生成不必在开始前写死全部动作。用户可以在生成过程中给某个物体追加速度方向,模型再继续合成多物体运动。它用位置图和跟踪图保存场景状态,在合成基准上将运动分布距离降低
达姆施塔特工业大学提出ReImaGin,让多模态模型遇到空间问题时先生成一张中间图,再根据这张图回答。它可以移除遮挡、连接轨迹,或把多个房间视角整理成平面图。在多视角空间判断、碰撞预测等六项任务上,这条“先画再想”的路线超过纯文字推理和固定
微软研究院、威斯康星大学麦迪逊分校、加州大学圣迭戈分校提出注册令牌,让扩散语言模型跨段推理时不必一直保留全部草稿。模型写完一段就清除文字,只把少量固定位置的隐藏状态传给下一段。在LLaDA和Dream实验中,这种连续记忆在所有主要基准超过文
Meta、卡内基梅隆大学、利物浦约翰摩尔大学、德克萨斯大学阿灵顿分校提出一套低成本视频推理蒸馏方案。团队只选约900条模型最犹豫的样本,用4B教师补充合成推理,在单张A100上训练不到两小时。得到的2B模型在三个视频问答基准上超过最高大四倍
佐治亚理工学院、新加坡国立大学、北卡罗来纳州立大学等机构推出CADWorld,把七个电脑智能体送进FreeCAD完成200项机械设计任务。任务覆盖11类工作流,结果不看它点了多少按钮,而是直接检查保存文件的尺寸、约束、结构和制造状态。领先智
清华大学、大连理工大学、香港中文大学提出Weave,让人形机器人从人类示范学习边走、边保持平衡、边用双手操作物体。策略同时控制29个身体关节和12个手指关节,在九种物体的训练交互上成功率达到92.5%,无需额外训练执行未见序列时达到65.0
阶跃星辰、ACE、香港中文大学、加州大学圣迭戈分校提出StepAudio 3 Music,把“先编曲、再出声音”写进音乐生成流程。模型支持歌曲、器乐、干声配伴奏和翻唱,单次长度最长5分30秒。中间的ABC记谱计划让和声、节奏和旋律结构进入生
牛津大学、斯坦福大学、新加坡国立大学等机构提出PaperDoctor,让AI不再只给论文打分,而是定位原文、解释问题并给出修改方案。30篇在写论文的作者共评估1299条反馈,对其中证据判断的接受率为70.6%。这套系统还会检查代码和按优先级
麻省理工学院与英伟达提出Lightning Weave,把“答得更准”和“用更少Token”两类后训练能力组合进同一个学生模型。Qwen3.5-4B在LiveCodeBench v5上从41.7%升至54.2%,响应Token同时少9.6%
Sitefire提出SlopShape,不盯AI偏爱的单词,而是检查信息顺序、证据使用和语气等文章结构。它在268家公司、13500篇英文商业博客上,仅凭187个结构特征取得98.0宏F1,模型自行改写后仍为98.1;结果不能直接外推到中文
香港大学、香港科技大学(广州)、萨塞克斯大学和LIGHTSPEED提出Omni-Streaming Thinking,让实时音视频模型把早期判断先标成待验证,而不是立刻当事实。冻结Qwen3-Omni骨干并加轻量适配后,它在五项基准上相对最
作业帮发布DuplexDrama,用合成流程构造包含打断、附和、说半句和环境声的双工语音数据,总音频超过2000小时,并计划开放6400段双语对话、合计800小时的子集。它补足真实交谈的重叠现象;但主体是合成语音,不能等同于真实用户分布与隐
微软研究院、清华大学提出ESRL,在混合专家模型后训练时直接探索不同专家路由,而不是只提高文本采样温度。Qwen3-30B-A3B上,平均Pass@1和Pass@8比GRPO提高3.2与4.5个百分点;结果来自指定数学推理基准,不能推断所有
澳大利亚国立大学、阿德莱德大学、西湖大学、香港科技大学(广州)提出UniMo,用统一表示学习人和动物动作。配套UniML3D包含145907段动作与433388条描述,动物规模约为AnimalML3D的102倍;数据主要来自既有与合成资源,