arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

语言与多模态基础模型、推理、训练与能力评测。

2609.18323 大模型

MiniMax-H3会生成音视频,却只答对41.97%的物理推理题

复旦大学、新加坡国立大学和腾讯团队提出一套MiniMax-H3跨模态物理推理评测,包含517个样例。模型要把文字、图像、声音和前缀视频中的不完整线索拼在一起,最终总体成功率41.97%;其中视频决策推理最高为56.00%,音频消歧最低仅27

复旦大学、新加坡国立大学、腾讯等
文章封面
2609.17930 Agent

大模型越大越会查错?Google研究发现:头号评判器也不到三分之一

Google Research、Google DeepMind、加州大学洛杉矶分校和纽约大学分析2518条长任务智能体轨迹,人工标注6967个错误并归为78类。六个前沿模型担任评判器时,表现最好的也不能在三分之一以上的轨迹中正确定位首个错误

Google Research、Google DeepMind、加州大学洛杉矶分校、纽约大学等
文章封面
2609.17909 视觉与生成

生成视频真能玩了:Zing-0.5跑到24 FPS,每分钟不到1美分

SeedLeap.ai推出5B参数世界模型Zing-0.5,让用户同时用键盘动作和在线文字指令改变正在生成的画面。论文报告它以832×480分辨率达到24 FPS,服务器租赁成本估算约每流分钟0.009美元;不过长期状态保持和动作后果仍有限

SeedLeap.ai等
文章封面
2609.17248 视觉与生成

长视频AI只会看不会听?腾讯、清华新测试中强模型仍不到60%

腾讯、清华大学、中国科学院大学提出Video-HolmesV2,专门检查长视频AI能否把画面与声音放进同一条证据链。模型不只要选对答案,还要给出准确的视听时间位置,靠剧情常识猜中也会暴露。在这套新测试中,强专有模型准确率仍低于60%;团队还

腾讯、清华大学、中国科学院大学等
文章封面
2609.17521 视觉与生成

视频生成到一半还能改物体速度,宾大、Snap把运动误差降12%

宾夕法尼亚大学、Snap、阿卜杜拉国王科技大学提出PhysStream,让视频生成不必在开始前写死全部动作。用户可以在生成过程中给某个物体追加速度方向,模型再继续合成多物体运动。它用位置图和跟踪图保存场景状态,在合成基准上将运动分布距离降低

宾夕法尼亚大学、Snap、阿卜杜拉国王科技大学等
文章封面
2609.16409 视觉与生成

AI推理不只写草稿,还会先画图:六项视觉任务最高提升25%

达姆施塔特工业大学提出ReImaGin,让多模态模型遇到空间问题时先生成一张中间图,再根据这张图回答。它可以移除遮挡、连接轨迹,或把多个房间视角整理成平面图。在多视角空间判断、碰撞预测等六项任务上,这条“先画再想”的路线超过纯文字推理和固定

达姆施塔特工业大学等
文章封面
2609.16372 大模型

微软让AI清空草稿继续推理,只留少量记忆代码成绩涨19.5分

微软研究院、威斯康星大学麦迪逊分校、加州大学圣迭戈分校提出注册令牌,让扩散语言模型跨段推理时不必一直保留全部草稿。模型写完一段就清除文字,只把少量固定位置的隐藏状态传给下一段。在LLaDA和Dream实验中,这种连续记忆在所有主要基准超过文

微软研究院、威斯康星大学麦迪逊分校、加州大学圣迭戈分校等
文章封面
2609.16255 大模型

900条样本、单卡不到2小时,2B视频模型反超大四倍对手

Meta、卡内基梅隆大学、利物浦约翰摩尔大学、德克萨斯大学阿灵顿分校提出一套低成本视频推理蒸馏方案。团队只选约900条模型最犹豫的样本,用4B教师补充合成推理,在单张A100上训练不到两小时。得到的2B模型在三个视频问答基准上超过最高大四倍

Meta、卡内基梅隆大学、利物浦约翰摩尔大学、德克萨斯大学阿灵顿分校等
文章封面
2609.16251 Agent

AI会点鼠标却做不好CAD:200项任务领先智能体只过17.5%

佐治亚理工学院、新加坡国立大学、北卡罗来纳州立大学等机构推出CADWorld,把七个电脑智能体送进FreeCAD完成200项机械设计任务。任务覆盖11类工作流,结果不看它点了多少按钮,而是直接检查保存文件的尺寸、约束、结构和制造状态。领先智

佐治亚理工学院、新加坡国立大学、北卡罗来纳州立大学等
文章封面
2609.16683 具身智能与机器人

清华让人形机器人边走边干活,41个关节协同成功率92.5%

清华大学、大连理工大学、香港中文大学提出Weave,让人形机器人从人类示范学习边走、边保持平衡、边用双手操作物体。策略同时控制29个身体关节和12个手指关节,在九种物体的训练交互上成功率达到92.5%,无需额外训练执行未见序列时达到65.0

清华大学、大连理工大学、香港中文大学等
文章封面
2609.16034 大模型

StepAudio把AI音乐拉到5分30秒,先写编曲计划再生成整首歌

阶跃星辰、ACE、香港中文大学、加州大学圣迭戈分校提出StepAudio 3 Music,把“先编曲、再出声音”写进音乐生成流程。模型支持歌曲、器乐、干声配伴奏和翻唱,单次长度最长5分30秒。中间的ABC记谱计划让和声、节奏和旋律结构进入生

阶跃星辰、ACE、香港中文大学、加州大学圣迭戈分校等
文章封面
2609.16995 Agent

牛津、斯坦福给论文装上AI医生,30篇草稿诊断一致率70.6%

牛津大学、斯坦福大学、新加坡国立大学等机构提出PaperDoctor,让AI不再只给论文打分,而是定位原文、解释问题并给出修改方案。30篇在写论文的作者共评估1299条反馈,对其中证据判断的接受率为70.6%。这套系统还会检查代码和按优先级

牛津大学、斯坦福大学、新加坡国立大学等
文章封面
2609.15369 大模型

AI文章换词也藏不住?看结构仍能做到98.1 F1

Sitefire提出SlopShape,不盯AI偏爱的单词,而是检查信息顺序、证据使用和语气等文章结构。它在268家公司、13500篇英文商业博客上,仅凭187个结构特征取得98.0宏F1,模型自行改写后仍为98.1;结果不能直接外推到中文

Sitefire等
文章封面
2609.15128 大模型

画面先骗人、声音后纠错:新方法让流式多模态模型别急着下结论

香港大学、香港科技大学(广州)、萨塞克斯大学和LIGHTSPEED提出Omni-Streaming Thinking,让实时音视频模型把早期判断先标成待验证,而不是立刻当事实。冻结Qwen3-Omni骨干并加轻量适配后,它在五项基准上相对最

香港大学、香港科技大学(广州)、萨塞克斯大学、LIGHTSPEED等
文章封面
2609.12872 大模型

AI陪聊也学会抢话:2000小时数据塞进打断、附和和环境声

作业帮发布DuplexDrama,用合成流程构造包含打断、附和、说半句和环境声的双工语音数据,总音频超过2000小时,并计划开放6400段双语对话、合计800小时的子集。它补足真实交谈的重叠现象;但主体是合成语音,不能等同于真实用户分布与隐

作业帮等
文章封面
2609.13058 大模型

微软&清华换条专家路线,不加采样让Qwen推理再涨4.5点

微软研究院、清华大学提出ESRL,在混合专家模型后训练时直接探索不同专家路由,而不是只提高文本采样温度。Qwen3-30B-A3B上,平均Pass@1和Pass@8比GRPO提高3.2与4.5个百分点;结果来自指定数学推理基准,不能推断所有

微软研究院、清华大学等
文章封面
2609.12342 视觉与生成

人和动物共用一个动作模型,14.6万段动作跨过骨骼差异

澳大利亚国立大学、阿德莱德大学、西湖大学、香港科技大学(广州)提出UniMo,用统一表示学习人和动物动作。配套UniML3D包含145907段动作与433388条描述,动物规模约为AnimalML3D的102倍;数据主要来自既有与合成资源,

澳大利亚国立大学、阿德莱德大学、西湖大学、香港科技大学(广州)等
文章封面
↑