给AI图片调情绪不换内容,3300组实验测住语义漂移
兰州大学、中国矿业大学、深圳大学、新加坡国立大学等机构联合提出一种情绪可控图像方法,目标是只改变AI图片的情绪、不把内容一起换掉。方法用中性图作为语义锚点,在3300个提示词与情绪组合上降低情绪误差并改善CLIPScore;实验基于指定生成
兰州大学、中国矿业大学、深圳大学、新加坡国立大学等机构联合提出一种情绪可控图像方法,目标是只改变AI图片的情绪、不把内容一起换掉。方法用中性图作为语义锚点,在3300个提示词与情绪组合上降低情绪误差并改善CLIPScore;实验基于指定生成
伊利诺伊大学厄巴纳-香槟分校、Adobe研究院联合提出“替换记忆”实验,检查视频模型到底从历史帧拿走了什么。WorldMem中,来自同一轨迹但地点错误的记忆仍保留相对零内容参考94.1%的PSNR收益;这说明收益可能来自运动和场景先验,但结
AMD发布AMDKernelVault,把62153条执行验证的HIP内核、39893条Triton内核和2377条ROCm问答整理成训练资源,并用它训练本地8B模型智能体。它补上了GPU代码AI长期偏向CUDA的数据缺口;但正确性来自指定
西蒙菲莎大学、宾夕法尼亚大学、阿尔伯塔机器智能研究院提出IMLE-VLA,把机器人动作头从10次迭代采样改成一次生成,推理频率由15Hz升至55Hz。它在LIBERO平均成功率98.0%,真机也更顺更快;98.0%属于仿真基准,真机只验证4
论文公开页面未披露作者机构。SenseNova-U1.5是一款8B混合专家统一视觉模型,把图像理解、生成、编辑、多图参考和图文交错输出放进同一套端到端架构,并增加512到4096像素的高分辨率训练阶段;4K是论文报告的原生能力,不代表所有公
小米ASR团队提出Xiaomi-CocktailASR-1,用一段参考语音当“声纹提示词”,从多人重叠声音中只转写目标说话人;目标人没开口时,模型应输出空文本。它在AliMeeting远场测试的词错率为20.63%,但论文没有说明这项能力已
腾讯Hy基础模型前沿团队、新加坡国立大学等机构提出T1,让122B混合专家模型在真实云端终端里连续调用工具300多步。它在Terminal-Bench 2.1上解决64.0%的任务,同一测试框架下高于GPT-5.4的54.8%;测试在隔离沙
新加坡国立大学、Cardinal AI Lab、香港科技大学等机构提出VIP-Router,让多模态模型为每张图片单独选择视觉token剪枝策略,也可以判断这次不该剪。路由器新增参数仅占主干0.017%,在剪枝敏感的VTC-Bench Gr
Quome、华盛顿大学等机构提出“世界时间计算”:把领域规则写成可执行程序,自动生成带精确答案的训练轨迹。0.5B模型在60个训练世界学习后,对20个未见世界的诊断准确率提高29个百分点;收益主要出现在符号状态和短步推理,像素任务、长链任务
Snowflake AI Research、休斯敦大学、加州大学洛杉矶分校、香港大学等机构的研究团队制作HybridDeepResearch,让AI必须同时查网页和SQL数据库才能回答380道题。GLM-5.2、Claude Sonnet
香港科技大学、牛津大学联合检验一种省推理成本的做法:模型连续给出同一答案,就提前停止。团队预注册并回放3520条自共识规则,没有一条通过三项安全与节省门槛;在仍节省32% token的规则上,约九次停止有一次会截断模型后续改答。结论只针对单
加州大学圣地亚哥分校、EleutherAI联合制作BuzzASR,为102种语言分别微调Whisper语音识别模型。各语言最优版本在77种语言上超过Whisper-large-v3,字符错误率平均降低超过2.8倍;比较集中在FLEURS和C
Together AI、悉尼大学、伊利诺伊大学厄巴纳-香槟分校等机构提出Osprey,把预训练小模型改造成可跨目标复用的推测解码草稿器。它在229B参数的MiniMax-M2.5上把吞吐提高17.5%,平均接受长度提高22.7%;提升来自论
香港大学、香港科技大学(广州)、苏黎世联邦理工学院等机构的研究团队让一只灵巧手独立完成瓶子、注射器和马克笔三种双零件装配,策略只在仿真中训练,随后直接迁移到真机。它不借助第二机械臂或外部夹具,但实验对象都是刚性零件,距离杂乱工位上的通用装配
威斯康星大学麦迪逊分校、微软研究院、佐治亚理工学院联合提出ExecCritic,把代码测试和源码修复交给两个分别训练的Qwen角色。两者组合在SWE-bench Verified解决72.6%的任务,比原始无测试基线高11.4个百分点;但质
悉尼大学、北京大学、中国科学院大学联合提出ReMoMask-2,让文本生成动作时直接检索模型内部的动作表示,省掉旧版完整两阶段流程。单个掩码Transformer阶段就在HumanML3D、KIT-ML和SnapMoGen实验中超过旧版,并
洛桑联邦理工学院、华为Bayer实验室、博洛尼亚大学联合提出Marigold V2,把现代图像生成模型改造成一次前向计算即可输出深度图的估计器。它在KITTI和ETH3D上把AbsRel误差相对此前最佳结果改善16%—26%,并能保留毛发、
北京大学、华南理工大学、新加坡国立大学联合提出MobileVLA-R1 2.0,让移动机器人先理解指令和环境,再输出能执行的导航与操作命令。宇树G1在论文设定的真实移动操作任务中,完整任务成功率比上一版提高10个百分点。它回答的是机器人怎样
杜克大学与清华大学团队提出PlaidQ,把连续扩散代码模型从512次去噪蒸馏到16步、少数步乃至一步。16步学生在HumanEval和MBPP+的pass@10超过教师;一步模型也能生成可执行程序,但HumanEval pass@1仅7.0
亚马逊团队开源Mitra-v2,一款7700万参数的表格基础模型。在TabArena协议下,它达到16亿参数TabFM的同级表现,参数量约为后者5%;预训练只用合成数据,再在300多个真实数据集上评估。结论限定于表格分类与回归基准,医疗等示