百度让网页AI边运行边改:9B模型做到57.52%,超过万亿参数方案
百度、华中科技大学联合提出RILA,让网页生成智能体把代码放进真实浏览器运行,重放参考操作后再按错误反馈修改。配套训练流程把Qwen3.5-9B在IWR-Bench上的得分从40.40%提高到57.52%,高于论文所测的Kimi-K2.6和
百度、华中科技大学联合提出RILA,让网页生成智能体把代码放进真实浏览器运行,重放参考操作后再按错误反馈修改。配套训练流程把Qwen3.5-9B在IWR-Bench上的得分从40.40%提高到57.52%,高于论文所测的Kimi-K2.6和
香港中文大学(深圳)、新加坡国立大学、英伟达、微软亚洲研究院等机构联合提出SolarWM,把10个数据集的143万段视频整理成统一训练流水线。模型只用5秒序列训练,却能连续生成分钟到小时级实时轨迹,方便研究者比较不同视频骨干;这些轨迹仍是固
约克大学、Vector研究院、Meta FAIR、麦吉尔大学联合逐层分析V-JEPA 2和VideoMAE-v2。两种视频模型的镜头运动探针ROC AUC超过90%,异常检测超过60%,直觉物理任务却接近随机水平。
香港大学、中山大学提出PredErase,用冻结的FLUX.2和I-JEPA同时移除物体及其掩码外光影残留。方法不做额外训练,重点处理传统填充模型删掉主体后仍留下的投影、接触阴影和支撑面痕迹。
微软研究院、伊利诺伊大学厄巴纳-香槟分校提出StudentSim,用少量个人学习记录训练个性化学生模拟器。评测覆盖国际象棋、英语写作和数学三类任务、60名学生,论文称StudentSim在行为保真度和指导响应性上均超过GPT-5.4。
同济大学、腾讯、南洋理工大学、香港科技大学联合提出MegaStyle++。团队用分层定义整理15万种整体风格身份、100万条细粒度风格提示和800万张风格化图像,希望把“风格”从模糊标签变成可解释结构。
腾讯混元、北京电影学院、北京大学、深圳大学联合提出DramaChain Bench,把AI短剧从剧本、分镜、关键帧、镜头视频到成片的完整链路纳入评测。5785个条目产生17488个有效评分和255925条可追溯归因记录。
魏茨曼科学研究所、麻省理工学院提出FoldingAgent,让视觉语言模型从折纸演示视频反推出可执行的参数化折叠程序。在PurelandFold基准上,完整序列完成率为100%,已完成步骤的编译成功率为96%。
通义千问团队、华中科技大学联合提出Qwen-Drive-1.0。这个4B视觉语言模型把3D感知、驾驶视觉问答和运动规划放进同一框架,并在开环、伪闭环和闭环设置中评估规划表现。
佛罗里达人机认知研究所、西佛罗里达大学提出一套可在机器人运行时编辑的行为系统。Unitree H1-2和自研Alex人形机器人完成六类真实任务,其中推门穿越用时34秒,在人为干扰下分拣六个彩球用时45秒。
腾讯、新加坡国立大学、香港理工大学联合提出H3-World,把330亿参数的MiniMax-H3视频生成器改造成可交互世界模型。团队使用8000个游戏样本、10000步LoRA优化,只训练0.199%的参数,就获得角色动作和镜头运动的分段控
南洋理工大学团队提出Facet-0,让机器人在电脑部件装配中同时预测动作和接触后果。系统在五项亚毫米任务上的平均成功率达到82%,论文报告的最强匹配基线为15%,放置精度为0.5毫米,命令延迟为50毫秒。
腾讯微信AI与南加州大学提出AlgoWorlds,用240个可验证环境测试工具智能体能否做出全局最优决策。七款前沿模型大多能提交可行方案,但表现最好的Claude Opus 4.8精确最优率也只有38.61%。
同济大学、快手科技和复旦大学提出CineForge,让长视频制作智能体从一次次完整制作记录中提炼可复用策略。经过跨故事演化后,CineScope-Metric由4.024提高到4.380,在新故事上的复审大模型调用减少37.0%。
香港科技大学(广州)、腾讯元宝、清华大学和腾讯ARC实验室联合发布SnapBench,系统测试手机“拍照再提问”检索遇到的脏输入。基准包含1145个查询、9085个图库候选和53种受控损坏,并评估16种多模态检索器。
浙江大学和苹果提出PaperGym,把每篇论文转成一套研究计划训练环境,并发布2万条实例。按同一训练方案得到的Qwen3-8B在ResearchQA上达到73.48,高于论文所列的更大模型Kimi K2.6;这一比较只对应单项评测,不代表综
阿里巴巴通义千问团队、香港科技大学和淘宝天猫集团推出E-Commerce Bench,让18款前沿大模型从10万元启动资金出发,连续经营365天线上商店。GPT-5.6 Sol的年末资产最高,均值达到1431425元,但它在欺诈规避维度只排
谷歌、北京大学、加州大学洛杉矶分校和伊利诺伊大学厄巴纳-香槟分校联合提出PaperBanana-Interact,让AI像设计协作者一样根据作者反馈反复修改论文图。与多轮基线相比,系统的质量分提高11.9至18.6分,遗忘旧要求的分数下降3
黎曼动力学发布Matrix-Game 3.5,把交互式世界模型的连续生成拉到分钟级,并支持用户实时控制镜头。系统在Matrix-Game 3.0基础上加入几何感知记忆、静态与动态分离表示,以及两阶段实时蒸馏,目标是让生成世界转身后还能记得来
字节跳动Seed、北京大学和浙江大学联合提出Lucida,把一段真实室内视频转成仿真可用的场景副本:房间里的物体不仅被重建,还能作为独立3D资产移动和编辑。论文报告其场景F-Score由SAM3D的0.794提高到0.924。