arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2609.02088 Agent

百度让网页AI边运行边改:9B模型做到57.52%,超过万亿参数方案

百度、华中科技大学联合提出RILA,让网页生成智能体把代码放进真实浏览器运行,重放参考操作后再按错误反馈修改。配套训练流程把Qwen3.5-9B在IWR-Bench上的得分从40.40%提高到57.52%,高于论文所测的Kimi-K2.6和

百度、华中科技大学等
文章封面
2609.02886 视觉与生成

英伟达等做出SolarWM:只看5秒训练片段,也能实时推演数小时

香港中文大学(深圳)、新加坡国立大学、英伟达、微软亚洲研究院等机构联合提出SolarWM,把10个数据集的143万段视频整理成统一训练流水线。模型只用5秒序列训练,却能连续生成分钟到小时级实时轨迹,方便研究者比较不同视频骨干;这些轨迹仍是固

香港中文大学(深圳)、新加坡国立大学、英伟达、微软亚洲研究院等
文章封面
2609.01551 视觉与生成

Meta研究发现:视频模型懂镜头运动,直觉物理却接近随机

约克大学、Vector研究院、Meta FAIR、麦吉尔大学联合逐层分析V-JEPA 2和VideoMAE-v2。两种视频模型的镜头运动探针ROC AUC超过90%,异常检测超过60%,直觉物理任务却接近随机水平。

约克大学、Vector研究院、Meta FAIR、麦吉尔大学等
文章封面
2609.00956 视觉与生成

删掉物体还不够,港大方法连掩码外的阴影一起清理

香港大学、中山大学提出PredErase,用冻结的FLUX.2和I-JEPA同时移除物体及其掩码外光影残留。方法不做额外训练,重点处理传统填充模型删掉主体后仍留下的投影、接触阴影和支撑面痕迹。

香港大学、中山大学等
文章封面
2609.01591 更多前沿

微软让AI模拟学生,三类任务两项指标都超过GPT-5.4

微软研究院、伊利诺伊大学厄巴纳-香槟分校提出StudentSim,用少量个人学习记录训练个性化学生模拟器。评测覆盖国际象棋、英语写作和数学三类任务、60名学生,论文称StudentSim在行为保真度和指导响应性上均超过GPT-5.4。

微软研究院、伊利诺伊大学厄巴纳-香槟分校等
文章封面
2609.01423 视觉与生成

腾讯整理800万张风格图:15万种风格身份、100万条描述

同济大学、腾讯、南洋理工大学、香港科技大学联合提出MegaStyle++。团队用分层定义整理15万种整体风格身份、100万条细粒度风格提示和800万张风格化图像,希望把“风格”从模糊标签变成可解释结构。

同济大学、腾讯、南洋理工大学、香港科技大学等
文章封面
2609.00646 视觉与生成

腾讯拆开AI短剧流水线:5785项样本追踪缺陷如何传到成片

腾讯混元、北京电影学院、北京大学、深圳大学联合提出DramaChain Bench,把AI短剧从剧本、分镜、关键帧、镜头视频到成片的完整链路纳入评测。5785个条目产生17488个有效评分和255925条可追溯归因记录。

腾讯混元、北京电影学院、北京大学、深圳大学等
文章封面
2609.00377 Agent

AI看一遍折纸视频,生成可执行程序,完整序列完成率100%

魏茨曼科学研究所、麻省理工学院提出FoldingAgent,让视觉语言模型从折纸演示视频反推出可执行的参数化折叠程序。在PurelandFold基准上,完整序列完成率为100%,已完成步骤的编译成功率为96%。

魏茨曼科学研究所、麻省理工学院等
文章封面
2609.00111 自动驾驶

Qwen下场做自动驾驶,一个4B模型同时感知、问答和规划

通义千问团队、华中科技大学联合提出Qwen-Drive-1.0。这个4B视觉语言模型把3D感知、驾驶视觉问答和运动规划放进同一框架,并在开环、伪闭环和闭环设置中评估规划表现。

通义千问团队、华中科技大学等
文章封面
2609.01518 具身智能与机器人

人形机器人34秒推门、45秒分球,行为还能现场改

佛罗里达人机认知研究所、西佛罗里达大学提出一套可在机器人运行时编辑的行为系统。Unitree H1-2和自研Alex人形机器人完成六类真实任务,其中推门穿越用时34秒,在人为干扰下分拣六个彩球用时45秒。

佛罗里达人机认知研究所、西佛罗里达大学等
文章封面
2609.01560 视觉与生成

腾讯把视频模型变成交互世界,只训练0.199%参数

腾讯、新加坡国立大学、香港理工大学联合提出H3-World,把330亿参数的MiniMax-H3视频生成器改造成可交互世界模型。团队使用8000个游戏样本、10000步LoRA优化,只训练0.199%的参数,就获得角色动作和镜头运动的分段控

腾讯、新加坡国立大学、香港理工大学等
文章封面
2609.01596 具身智能与机器人

南洋理工让机器人装电脑,五项亚毫米任务成功率82%

南洋理工大学团队提出Facet-0,让机器人在电脑部件装配中同时预测动作和接触后果。系统在五项亚毫米任务上的平均成功率达到82%,论文报告的最强匹配基线为15%,放置精度为0.5毫米,命令延迟为50毫秒。

南洋理工大学等
文章封面
2608.29621 Agent

快手等让长视频智能体从制作记录里自我改进,复审调用降37%

同济大学、快手科技和复旦大学提出CineForge,让长视频制作智能体从一次次完整制作记录中提炼可复用策略。经过跨故事演化后,CineScope-Metric由4.024提高到4.380,在新故事上的复审大模型调用减少37.0%。

同济大学、快手科技、复旦大学等
长视频制作智能体从完整轨迹中积累经验
2608.29607 视觉与生成

腾讯元宝测了53种拍照损坏:图片一糊,比问题写错字更伤检索

香港科技大学(广州)、腾讯元宝、清华大学和腾讯ARC实验室联合发布SnapBench,系统测试手机“拍照再提问”检索遇到的脏输入。基准包含1145个查询、9085个图库候选和53种受控损坏,并评估16种多模态检索器。

香港科技大学(广州)、腾讯元宝、清华大学、腾讯ARC实验室等
同一张照片在不同损坏程度下的对比
2608.30730 Agent

阿里让18款大模型经营一年网店,10万启动金最高变143万

阿里巴巴通义千问团队、香港科技大学和淘宝天猫集团推出E-Commerce Bench,让18款前沿大模型从10万元启动资金出发,连续经营365天线上商店。GPT-5.6 Sol的年末资产最高,均值达到1431425元,但它在欺诈规避维度只排

阿里巴巴通义千问团队、香港科技大学、淘宝天猫集团等
大模型智能体经营线上商店的年度实验
2608.30241 Agent

谷歌等让AI反复改论文图,质量提升最高18.6分

谷歌、北京大学、加州大学洛杉矶分校和伊利诺伊大学厄巴纳-香槟分校联合提出PaperBanana-Interact,让AI像设计协作者一样根据作者反馈反复修改论文图。与多轮基线相比,系统的质量分提高11.9至18.6分,遗忘旧要求的分数下降3

谷歌、北京大学、加州大学洛杉矶分校、伊利诺伊大学厄巴纳-香槟分校等
AI按照反馈多轮修改科学图表
2608.29910 视觉与生成

黎曼动力学让AI世界连续玩到分钟级,还能实时转动镜头

黎曼动力学发布Matrix-Game 3.5,把交互式世界模型的连续生成拉到分钟级,并支持用户实时控制镜头。系统在Matrix-Game 3.0基础上加入几何感知记忆、静态与动态分离表示,以及两阶段实时蒸馏,目标是让生成世界转身后还能记得来

黎曼动力学等
分钟级实时交互的生成式世界
2608.30821 视觉与生成

字节Seed把真实房间变成可编辑仿真场景,F-Score升至0.924

字节跳动Seed、北京大学和浙江大学联合提出Lucida,把一段真实室内视频转成仿真可用的场景副本:房间里的物体不仅被重建,还能作为独立3D资产移动和编辑。论文报告其场景F-Score由SAM3D的0.794提高到0.924。

字节跳动Seed、北京大学、浙江大学等
真实室内空间被还原成可编辑仿真场景