arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

语言与多模态基础模型、推理、训练与能力评测。

2609.12830 视觉与生成

给AI图片调情绪不换内容,3300组实验测住语义漂移

兰州大学、中国矿业大学、深圳大学、新加坡国立大学等机构联合提出一种情绪可控图像方法,目标是只改变AI图片的情绪、不把内容一起换掉。方法用中性图作为语义锚点,在3300个提示词与情绪组合上降低情绪误差并改善CLIPScore;实验基于指定生成

兰州大学、中国矿业大学、深圳大学、新加坡国立大学等
文章封面
2609.12090 视觉与生成

视频AI记错了也能用?错误记忆竟保住94.1%收益

伊利诺伊大学厄巴纳-香槟分校、Adobe研究院联合提出“替换记忆”实验,检查视频模型到底从历史帧拿走了什么。WorldMem中,来自同一轨迹但地点错误的记忆仍保留相对零内容参考94.1%的PSNR收益;这说明收益可能来自运动和场景先验,但结

伊利诺伊大学厄巴纳-香槟分校、Adobe研究院等
文章封面
2609.12471 AI基础设施

AMD补齐CUDA之外的训练库:10万级内核数据喂给本地AI

AMD发布AMDKernelVault,把62153条执行验证的HIP内核、39893条Triton内核和2377条ROCm问答整理成训练资源,并用它训练本地8B模型智能体。它补上了GPU代码AI长期偏向CUDA的数据缺口;但正确性来自指定

AMD等
文章封面
2609.10915 具身智能与机器人

机器人不再走走停停:IMLE-VLA把动作推理从15Hz拉到55Hz

西蒙菲莎大学、宾夕法尼亚大学、阿尔伯塔机器智能研究院提出IMLE-VLA,把机器人动作头从10次迭代采样改成一次生成,推理频率由15Hz升至55Hz。它在LIBERO平均成功率98.0%,真机也更顺更快;98.0%属于仿真基准,真机只验证4

西蒙菲莎大学、宾夕法尼亚大学、阿尔伯塔机器智能研究院等
文章封面
2609.11929 大模型

8B模型直出4K图,SenseNova-U1.5把看图和生图塞进一套架构

论文公开页面未披露作者机构。SenseNova-U1.5是一款8B混合专家统一视觉模型,把图像理解、生成、编辑、多图参考和图文交错输出放进同一套端到端架构,并增加512到4096像素的高分辨率训练阶段;4K是论文报告的原生能力,不代表所有公

论文公开页面未披露作者机构
文章封面
2609.11274 大模型

小米让AI在多人吵成一团时只听你,真实会议词错率20.63%

小米ASR团队提出Xiaomi-CocktailASR-1,用一段参考语音当“声纹提示词”,从多人重叠声音中只转写目标说话人;目标人没开口时,模型应输出空文本。它在AliMeeting远场测试的词错率为20.63%,但论文没有说明这项能力已

小米等
文章封面
2609.11042 Agent

腾讯T1终端智能体硬刚GPT-5.4,300多步工具调用不掉链

腾讯Hy基础模型前沿团队、新加坡国立大学等机构提出T1,让122B混合专家模型在真实云端终端里连续调用工具300多步。它在Terminal-Bench 2.1上解决64.0%的任务,同一测试框架下高于GPT-5.4的54.8%;测试在隔离沙

腾讯Hy基础模型前沿团队、新加坡国立大学等
文章封面
2609.10346 AI基础设施

只加0.017%参数,多模态AI准确率相对涨26.9%

新加坡国立大学、Cardinal AI Lab、香港科技大学等机构提出VIP-Router,让多模态模型为每张图片单独选择视觉token剪枝策略,也可以判断这次不该剪。路由器新增参数仅占主干0.017%,在剪枝敏感的VTC-Bench Gr

新加坡国立大学、Cardinal AI Lab、香港科技大学等
文章封面
2609.09163 大模型

给小模型造60个代码世界,准确率猛涨29个百分点

Quome、华盛顿大学等机构提出“世界时间计算”:把领域规则写成可执行程序,自动生成带精确答案的训练轨迹。0.5B模型在60个训练世界学习后,对20个未见世界的诊断准确率提高29个百分点;收益主要出现在符号状态和短步推理,像素任务、长链任务

Quome、华盛顿大学等
文章封面
2609.09410 Agent

网页会搜、SQL会写,顶级AI合起来却只过一半

Snowflake AI Research、休斯敦大学、加州大学洛杉矶分校、香港大学等机构的研究团队制作HybridDeepResearch,让AI必须同时查网页和SQL数据库才能回答380道题。GLM-5.2、Claude Sonnet

Snowflake AI Research、休斯敦大学、加州大学洛杉矶分校、香港大学等
文章封面
2609.09989 大模型

AI连续答对也别急停:3520条省token规则全军覆没

香港科技大学、牛津大学联合检验一种省推理成本的做法:模型连续给出同一答案,就提前停止。团队预注册并回放3520条自共识规则,没有一条通过三项安全与节省门槛;在仍节省32% token的规则上,约九次停止有一次会截断模型后续改答。结论只针对单

香港科技大学、牛津大学等
文章封面
2609.09554 大模型

一个Whisper不够用?102个单语模型赢下77种语言

加州大学圣地亚哥分校、EleutherAI联合制作BuzzASR,为102种语言分别微调Whisper语音识别模型。各语言最优版本在77种语言上超过Whisper-large-v3,字符错误率平均降低超过2.8倍;比较集中在FLEURS和C

加州大学圣地亚哥分校、EleutherAI等
文章封面
2609.09338 AI基础设施

Together AI让229B大模型推理快17.5%

Together AI、悉尼大学、伊利诺伊大学厄巴纳-香槟分校等机构提出Osprey,把预训练小模型改造成可跨目标复用的推测解码草稿器。它在229B参数的MiniMax-M2.5上把吞吐提高17.5%,平均接受长度提高22.7%;提升来自论

Together AI、悉尼大学、伊利诺伊大学厄巴纳-香槟分校等
文章封面
2609.10137 具身智能与机器人

机器人一只手拧瓶盖,3种装配任务直接上真机

香港大学、香港科技大学(广州)、苏黎世联邦理工学院等机构的研究团队让一只灵巧手独立完成瓶子、注射器和马克笔三种双零件装配,策略只在仿真中训练,随后直接迁移到真机。它不借助第二机械臂或外部夹具,但实验对象都是刚性零件,距离杂乱工位上的通用装配

香港大学、香港科技大学(广州)、苏黎世联邦理工学院等
文章封面
2609.09133 Agent

测试写错还不如不测:微软等让代码智能体修复率冲到72.6%

威斯康星大学麦迪逊分校、微软研究院、佐治亚理工学院联合提出ExecCritic,把代码测试和源码修复交给两个分别训练的Qwen角色。两者组合在SWE-bench Verified解决72.6%的任务,比原始无测试基线高11.4个百分点;但质

威斯康星大学麦迪逊分校、微软研究院、佐治亚理工学院等
文章封面
2609.08365 视觉与生成

动作生成砍掉一整个阶段,北大等ReMoMask-2反而更快更准

悉尼大学、北京大学、中国科学院大学联合提出ReMoMask-2,让文本生成动作时直接检索模型内部的动作表示,省掉旧版完整两阶段流程。单个掩码Transformer阶段就在HumanML3D、KIT-ML和SnapMoGen实验中超过旧版,并

悉尼大学、北京大学、中国科学院大学等
文章封面
2609.08084 视觉与生成

一张照片也能看清发丝深度,Marigold V2误差再降16%—26%

洛桑联邦理工学院、华为Bayer实验室、博洛尼亚大学联合提出Marigold V2,把现代图像生成模型改造成一次前向计算即可输出深度图的估计器。它在KITTI和ETH3D上把AbsRel误差相对此前最佳结果改善16%—26%,并能保留毛发、

洛桑联邦理工学院、华为Bayer实验室、博洛尼亚大学等
文章封面
2609.06251 具身智能与机器人

北大等让宇树G1边走边干活,完整任务成功率提高10个百分点

北京大学、华南理工大学、新加坡国立大学联合提出MobileVLA-R1 2.0,让移动机器人先理解指令和环境,再输出能执行的导航与操作命令。宇树G1在论文设定的真实移动操作任务中,完整任务成功率比上一版提高10个百分点。它回答的是机器人怎样

北京大学、华南理工大学、新加坡国立大学等
文章封面
2609.04531 大模型

写代码从512步砍到1步,杜克清华让扩散模型极速出答案

杜克大学与清华大学团队提出PlaidQ,把连续扩散代码模型从512次去噪蒸馏到16步、少数步乃至一步。16步学生在HumanEval和MBPP+的pass@10超过教师;一步模型也能生成可执行程序,但HumanEval pass@1仅7.0

杜克大学、清华大学等
文章封面
2609.04540 大模型

只用5%参数追平16亿模型,亚马逊开源Mitra-v2

亚马逊团队开源Mitra-v2,一款7700万参数的表格基础模型。在TabArena协议下,它达到16亿参数TabFM的同级表现,参数量约为后者5%;预训练只用合成数据,再在300多个真实数据集上评估。结论限定于表格分类与回归基准,医疗等示

亚马逊等
文章封面
↑