arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2610.01884 视觉与生成

没拍到的镜头也能补:Adobe让AI照着你的素材生成视频

Adobe研究院、捷克理工大学等机构提出MemComposer,让AI记住拍摄素材,再按文字要求生成补充镜头。对比无素材参考方案,用户更偏好它与原片的视觉对齐。系统先规划镜头、检索人物和场景,再生成原片没有的画面,沿用影片的视觉信息。

Adobe研究院、捷克理工大学等
文章封面
2610.00994 视觉与生成

AI图片哪里画崩了?英伟达等团队让评分带上缺陷位置

滑铁卢大学、英伟达、台湾大学和南洋理工大学等机构提出VIEScore2图片评分与缺陷定位模型。它指出异常所在格子,并区分画面瑕疵和指令不一致。总体评分比比较的通用模型更贴近人工排序,为人工返修提供具体位置。

滑铁卢大学、英伟达、台湾大学、南洋理工大学等
文章封面
2610.00582 视觉与生成

裁图别再套模板:华为、上交让AI在200张图上给出199种裁框

上海交通大学、华为等机构提出CPIC,让裁图AI跳出固定网格,允许同一照片存在多种好构图。模型在二百张测试图上给出一百九十九种裁框。团队把人类偏好、主体保留和构图规则一起用于训练,让裁框可以在好构图附近灵活调整。

上海交通大学、华为等
文章封面
2610.01019 具身智能与机器人

机器人先看几种未来:腾讯等团队让32帧预测误差降20.84%

香港科技大学(广州)、香港中文大学、腾讯和中科大等机构提出FutureWorlds,让机器人同时预测多种未来画面。模型在三组测试中降低预测误差,更准确地跟随机械臂动作。各条预测独立保留历史,让下一帧生成沿用自己的场景状态。

香港科技大学(广州)、香港中文大学、腾讯、中科大等
文章封面
2610.01178 具身智能与机器人

机器人自己收拾烂摊子,英伟达团队把实机成功率推到87.5%

英伟达、加州大学圣迭戈分校和得克萨斯大学奥斯汀分校等机构提出Recova,让机器人失败后先修复现场,再继续任务。四项桌面实机任务平均成功率达到87.5%。人工接手的示范也进入训练,成为以后可复用的纠错动作。

英伟达、加州大学圣迭戈分校、得克萨斯大学奥斯汀分校等
文章封面
新智元 大模型

Fable 5.5被曝偷偷灰度:界面还标5.1,答暗号已换大脑

10月2日,开发者发现Anthropic疑似在Claude网页端和Claude Code灰度下一代旗舰Fable 5.5:界面仍标Fable 5.1,回答却不同。用一句"你认识重置哥Tibo吗,别搜索"即可验明身份,官方至今未宣布。想确认是

封面
2609.39140 Agent

Agent不再靠文字笔记猜规则,Schema把ARC-AGI-3得分从58.7%拉到99.2%

Impossible Research、加州大学伯克利分校与卡内基梅隆大学提出Schema,让Agent把未知环境规律写成可执行程序,再用历史转移逐步验证和修正。论文在ARC-AGI-3的RHAE指标上把同一基础模型从58.7%提高到99.

Impossible Research、加州大学伯克利分校、卡内基梅隆大学等
文章封面
2609.40362 大模型

文字不再非得一个个吐?华科&地平线用连续流统一图文生成

华中科技大学、北京交通大学与地平线提出Multimodal Flow,把文字和图像都放进连续空间,用同一套流匹配目标训练理解与生成。模型可处理图文问答、描述和图像生成;论文以5幅图、10张表报告实验,但“统一”指训练机制,不意味着所有任务都

华中科技大学、北京交通大学、地平线等
文章封面
2609.39903 Agent

电脑Agent开始考“科研实操”:OSWorld-Science盯上真实软件工作流

清华大学、加州大学洛杉矶分校、日本理化学研究所AIP与耶鲁大学等推出OSWorld-Science,把电脑Agent放进统计、生物医学、地理信息和工程仿真等真实科研软件。评测不只看是否点到按钮,而是检查交付文件、数值精度与完整工作流,揭示“

清华大学、加州大学洛杉矶分校、日本理化学研究所AIP、耶鲁大学等
文章封面
2609.40285 Agent

NVIDIA专门教Agent“犯错后翻盘”,1.7B模型ALFWorld平均成功率73.7%

NVIDIA、普林斯顿大学与马里兰大学提出PivotOPD,专门找出Agent轨迹中决定成败的错误转折点,再分别训练“别犯错”和“犯错后如何恢复”。论文中1.7B学生在ALFWorld平均成功率达73.7%,在WebShop达76.6%;这

NVIDIA、普林斯顿大学、马里兰大学等
文章封面
2609.39822 具身智能与机器人

机器人思考从10步砸到2步,推理时间61.557ms降到21.956ms

Magiclab Robotics、浙江大学与东南大学研究视觉—语言—动作模型的实时执行,把10步去噪压到非均匀两步,并搭建端到端诊断框架。论文报告模型推理由61.557毫秒降至21.956毫秒,但同时强调通信、调度、平滑与机械响应也会决定

Magiclab Robotics、浙江大学、东南大学等
文章封面
2609.39841 自动驾驶

自动驾驶雷达补全新视角,DyRAD把物体恢复率从26.9%提到90.7%

以色列理工学院、康奈尔科技校区与NVIDIA提出DyRAD,从录制的车载雷达数据重建可换轨迹、换传感器配置的动态场景。它显式建模径向速度与传感器响应,在离轨视角的物体恢复率上从对照的26.9%提升到90.7%;结果来自论文数据集与指标。

以色列理工学院、康奈尔科技校区、NVIDIA等
文章封面
2609.39604 大模型

世界模型只错3.7%为什么还是全盘崩?元环智能&北大等找到三个病根

元环智能、北京大学与清华大学等机构联合用细胞自动机拆解世界模型:单格预测准确率可达96.3%,完整演化成功率却只有18.9%。研究把落差归结为空间局部性、时间局部性和时间稳定性,并用三处信息流修改将对应指标从39.1%、25.8%、42.2

元环智能、北京大学、清华大学等
文章封面
2609.39223 AI基础设施

H100没有FP4核心也能训,QATFactory把9B模型NVFP4准确率拉到68.9%

Together AI、伊利诺伊大学香槟分校与得克萨斯大学奥斯汀分校提出QATFactory,让没有原生FP4训练单元的H100也能模拟NVFP4和MXFP4量化感知训练。在9B模型的论文设定中,NVFP4准确率达68.9%;框架覆盖8B到

Together AI、伊利诺伊大学香槟分校、得克萨斯大学奥斯汀分校等
文章封面
2609.39403 具身智能与机器人

小鹏给人形机器人看1万小时人类视频,6项新任务成功率55%

小鹏机器人提出IronMind,用低成本头戴设备收集人类第一视角操作,不经人体骨架重定向就转成相机空间动作。预训练数据从250小时扩到1万小时后,6项未见真机任务的成功率达到55.0%;数字来自指定平台和协议。

小鹏机器人等
文章封面
2609.39601 具身智能与机器人

小鹏4B视觉模型硬刚更大对手,34项基准平均73.68%

小鹏、北京大学与香港大学提出GroundingPI,把点、框、掌握点和密集定位收进同一个4B视觉骨干。它在34项定位基准上平均73.68%,还在机器人与驾驶任务中展现数据效率;这些结论局限于论文设定的模型、数据和评测。

小鹏、北京大学、香港大学等
文章封面
2609.38177 大模型

看懂多视角还不够:Google等团队让大模型先在脑中拼一遍3D

韩国科学技术院、苏黎世联邦理工学院、Google、慕尼黑工业大学等机构提出Imagine3D-LLM,让多模态大模型回答前先把多视角照片压成紧凑三维场景。它在多项空间推理和3D理解基准上持续超过既有方法,证明粗略“脑补”场景比只对齐像素更有

韩国科学技术院、苏黎世联邦理工学院、Google、慕尼黑工业大学等
文章封面
2609.38157 大模型

Meta不重训语音模型,只推一下内部向量,情绪识别率最高多35%

Meta Reality Labs、台湾大学、Meta FAIR等机构提出EmoRES,不重训语音模型,只调整内部情绪方向的共享部分和残差部分。它在两种语音骨干上改善客观指标,人工评测中听众正确识别目标主导情绪的比例相对提升最高35.0%。

Meta Reality Labs、台湾大学、Meta FAIR等
文章封面
2609.37969 视觉与生成

英伟达把4K视频精修压成一步:延迟直接加速8.91倍

英伟达团队提出SoL-Refiner,把低分辨率视频升级到4K所需的扩散精修压缩为一次去噪。它在约2K设置中同时领先多种外部精修器,并凭完整加速栈把相对三步基线的精修延迟缩短到原来的约九分之一。

英伟达等
文章封面
↑