arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

语言与多模态基础模型、推理、训练与能力评测。

2610.11361 视觉与生成

视频生成自带分轨!谷歌等把人声和乐器声分别交出来

谷歌、特拉维夫大学等机构提出SepGen,生成视频时同时输出混合音频与两个独立声轨。示例包括演唱与乐器、人声对话等场景。同一模型还可以接收已有视频和音频进行分离,让画面中的发声对象参与判断声音应该归到哪一轨。

谷歌、特拉维夫大学等
文章封面
2610.10563 大模型

文字说错也不带偏?Meta等让AI看图答对率升至70.7%

卡内基梅隆大学、Meta联合提出SLVR,让AI先定位图片里的目标,再挑证据、组织答案,推理时不必写出长段过程。在300项带错误描述的诊断测试中,正确率从41.7%升至70.7%。模型可以回到画面核对颜色、数量和空间关系,减少跟着文字猜答案

卡内基梅隆大学、Meta等
文章封面
2610.08778 大模型

斯坦福等教AI因材施教,模拟学生答题率从48.6%升到69%

斯坦福大学、佐治亚理工学院、卡内基梅隆大学提出Sherpa,让AI老师根据模拟学生的学习效果调整讲解方式。在七类模拟学生上,教学后的平均答题率从48.6%提高到69.0%;教学评测分从52.5%升到79.2%。它把学生能否进步变成训练信号,

斯坦福大学、佐治亚理工学院、卡内基梅隆大学等
文章封面
2610.02882 AI基础设施

高通&密歇根大学给压缩计算补误差,DINOv3跑快1.5倍

高通AI研究院、密歇根大学等机构提出DyRA,在压缩矩阵计算之后,按当前输入补偿输出误差。DINOv3实测端到端GPU加速1.5倍,相比只压缩权重的对照,精度退化减少超过3倍。视觉、语音和语言实验显示,省计算时检查实际输出,比只追求权重接近

高通AI研究院、密歇根大学等
文章封面
2610.02599 更多前沿

AI能给植物肉试味?斯坦福等用2.1万次人类评价检验预测

斯坦福大学计算机科学系、Food Intelligence Lab、NECTAR、多伦多大学化学工程系等机构提出TasteBench,汇集超过2.1万次人类评价,检验AI预测植物食品与目标食品的口味相似度。同组比较中,最佳模型准确率66.1

斯坦福大学计算机科学系、Food Intelligence Lab、NECTAR、多伦多大学化学工程系等
文章封面
2610.03664 大模型

微软&港理工等让视频AI先想结局,四分之一训练步数超基线

微软、香港理工大学、加州大学戴维斯分校等机构提出ProAR,让持续生成视频的模型同时预想最终画面和下一步状态。VBVR十项任务中,平均成绩从0.663升到0.801;训练2500步时就超过训练10000步的标准基线。视频生成开始按目标和规则

微软、香港理工大学、加州大学戴维斯分校等
文章封面
新智元 大模型

Fable 5.5被曝偷偷灰度:界面还标5.1,答暗号已换大脑

10月2日,开发者发现Anthropic疑似在Claude网页端和Claude Code灰度下一代旗舰Fable 5.5:界面仍标Fable 5.1,回答却不同。用一句"你认识重置哥Tibo吗,别搜索"即可验明身份,官方至今未宣布。想确认是

封面
2609.39140 Agent

Agent不再靠文字笔记猜规则,Schema把ARC-AGI-3得分从58.7%拉到99.2%

Impossible Research、加州大学伯克利分校与卡内基梅隆大学提出Schema,让Agent把未知环境规律写成可执行程序,再用历史转移逐步验证和修正。论文在ARC-AGI-3的RHAE指标上把同一基础模型从58.7%提高到99.

Impossible Research、加州大学伯克利分校、卡内基梅隆大学等
文章封面
2609.40362 大模型

文字不再非得一个个吐?华科&地平线用连续流统一图文生成

华中科技大学、北京交通大学与地平线提出Multimodal Flow,把文字和图像都放进连续空间,用同一套流匹配目标训练理解与生成。模型可处理图文问答、描述和图像生成;论文以5幅图、10张表报告实验,但“统一”指训练机制,不意味着所有任务都

华中科技大学、北京交通大学、地平线等
文章封面
2609.40285 Agent

NVIDIA专门教Agent“犯错后翻盘”,1.7B模型ALFWorld平均成功率73.7%

NVIDIA、普林斯顿大学与马里兰大学提出PivotOPD,专门找出Agent轨迹中决定成败的错误转折点,再分别训练“别犯错”和“犯错后如何恢复”。论文中1.7B学生在ALFWorld平均成功率达73.7%,在WebShop达76.6%;这

NVIDIA、普林斯顿大学、马里兰大学等
文章封面
2609.39604 大模型

世界模型只错3.7%为什么还是全盘崩?元环智能&北大等找到三个病根

元环智能、北京大学与清华大学等机构联合用细胞自动机拆解世界模型:单格预测准确率可达96.3%,完整演化成功率却只有18.9%。研究把落差归结为空间局部性、时间局部性和时间稳定性,并用三处信息流修改将对应指标从39.1%、25.8%、42.2

元环智能、北京大学、清华大学等
文章封面
2609.39223 AI基础设施

H100没有FP4核心也能训,QATFactory把9B模型NVFP4准确率拉到68.9%

Together AI、伊利诺伊大学香槟分校与得克萨斯大学奥斯汀分校提出QATFactory,让没有原生FP4训练单元的H100也能模拟NVFP4和MXFP4量化感知训练。在9B模型的论文设定中,NVFP4准确率达68.9%;框架覆盖8B到

Together AI、伊利诺伊大学香槟分校、得克萨斯大学奥斯汀分校等
文章封面
2609.39403 具身智能与机器人

小鹏给人形机器人看1万小时人类视频,6项新任务成功率55%

小鹏机器人提出IronMind,用低成本头戴设备收集人类第一视角操作,不经人体骨架重定向就转成相机空间动作。预训练数据从250小时扩到1万小时后,6项未见真机任务的成功率达到55.0%;数字来自指定平台和协议。

小鹏机器人等
文章封面
2609.39601 具身智能与机器人

小鹏4B视觉模型硬刚更大对手,34项基准平均73.68%

小鹏、北京大学与香港大学提出GroundingPI,把点、框、掌握点和密集定位收进同一个4B视觉骨干。它在34项定位基准上平均73.68%,还在机器人与驾驶任务中展现数据效率;这些结论局限于论文设定的模型、数据和评测。

小鹏、北京大学、香港大学等
文章封面
2609.38177 大模型

看懂多视角还不够:Google等团队让大模型先在脑中拼一遍3D

韩国科学技术院、苏黎世联邦理工学院、Google、慕尼黑工业大学等机构提出Imagine3D-LLM,让多模态大模型回答前先把多视角照片压成紧凑三维场景。它在多项空间推理和3D理解基准上持续超过既有方法,证明粗略“脑补”场景比只对齐像素更有

韩国科学技术院、苏黎世联邦理工学院、Google、慕尼黑工业大学等
文章封面
2609.38157 大模型

Meta不重训语音模型,只推一下内部向量,情绪识别率最高多35%

Meta Reality Labs、台湾大学、Meta FAIR等机构提出EmoRES,不重训语音模型,只调整内部情绪方向的共享部分和残差部分。它在两种语音骨干上改善客观指标,人工评测中听众正确识别目标主导情绪的比例相对提升最高35.0%。

Meta Reality Labs、台湾大学、Meta FAIR等
文章封面
2609.37690 视觉与生成

视频越长,记忆却不涨:哈佛把世界模型塞进6张固定平面

哈佛大学、新加坡国立大学、麻省理工学院、MIT-IBM Watson AI Lab等机构提出Honeycomb,用六张固定尺寸的空间与时空平面保存长视频场景。实验表明它在记忆占用不随生成时长增长的同时,仍能在WorldScore与RealE

哈佛大学、新加坡国立大学、麻省理工学院、MIT-IBM Watson AI Lab等
文章封面
2609.37989 Agent

Google让Agent自己改数据流水线,51个表格任务直接包揽前五

Google Research、南加州大学、Google DeepMind、哈佛大学等机构联合提出TabFM-Auto,让Agent围绕冻结的表格基础模型自动修改数据流水线。它在TabArena的51个数据集上由五种配置包揽总榜前五,最佳方

Google Research、南加州大学、Google DeepMind、哈佛大学等
文章封面
↑