腾讯把3D理解、生成和编辑塞进一个模型,训练数据达8700万
腾讯混元公布Hunyuan3D-Buffalo 1.0,把3D问答与定位、文本生成3D、指令编辑3D和指定部件生成放进同一套架构。训练语料总规模为8700万条,包括2500万理解样本、5000万文本到3D配对和1200万编辑配对。
腾讯混元公布Hunyuan3D-Buffalo 1.0,把3D问答与定位、文本生成3D、指令编辑3D和指定部件生成放进同一套架构。训练语料总规模为8700万条,包括2500万理解样本、5000万文本到3D配对和1200万编辑配对。
复旦大学、哈尔滨工业大学和北京大学等团队复现了bfloat16 Transformer训练中的突然崩溃:模型可以正常运行很多步,注意力随后快速失控。研究发现,不同位置的低精度误差最终会汇入查询—键权重的共同通道。
康奈尔大学发布SoniSpeech,用带超声传感器的眼镜采集无声说话时的面部运动。数据集包含34小时、18000条话语和5356个独立单词,基线模型在开放词汇无声语音识别中的词错误率为26.3%。
中山大学、斯坦福大学和东南大学团队发布DynamicManip,只用一次静态任务示范生成多种动态操作训练数据。与对照方法相比,系统在论文任务上的平均成功率提高18.4个百分点,策略查询延迟降低32.9%。
中国科学院自动化研究所、香港中文大学、清华大学等团队发布WorldExam,用1474个案例评测20个可控视频与世界模型。没有一款模型同时覆盖大量任务并保持稳定高表现,画质好、指令完成度高,也不保证场景会作出合理反应。
南洋理工大学、剑桥大学、新加坡管理大学和CentraleSupélec团队发布CultureVidBench,用1000条提示测试7款文本生成视频模型。结果显示,模型能生成语义相符、画质不错的视频,却常把服饰、文字、仪式步骤和声音线索做错。
Google DeepMind、OpenAI、牛津大学、佐治亚理工学院和伊利诺伊大学厄巴纳-香槟分校等机构研究人员测试了275种大模型角色。多数角色会随着激活引导增强而更贴近设定,但有38种角色在六项指标上全部下降。
英特尔中国研究院发布ScaleQ-1.58,把推理大模型权重压缩为三值表示。Qwen3-1.7B版本只使用400万校准Token,在4项数学和代码任务上的平均表现达到BitNet b1.58 2B4T的90.52%以上,量化所需校准Toke
美团与清华大学团队训练了150多个视觉语言模型,覆盖34个大语言模型和7个模型家族,尝试在多模态训练开始前预测哪一个LLM更适合做视觉底座。
亚马逊研究人员用AI智能体模拟营销A/B测试,并拿67项历史实验验证预测结果。未经校准的系统能判断部分效果方向,方向重合度为0.70,但会系统性高估改版带来的影响。
阿里巴巴通义千问、中国人民大学、上海科技大学、北京通用人工智能研究院和北京航空航天大学团队发布Ego2Robot,把人类佩戴相机拍下的第一视角操作视频转换为机器人训练数据。整套数据达到18561小时,覆盖15种机器人形态。
Sakana AI与FARS等团队提出的一项自动科研基准,让Sakana AI v1、Sakana AI v2、CycleResearcher和Data-to-Paper围绕15个研究提案各写一篇论文,再让GPT-5.4、Gemini和Cl
俄罗斯Sirius教育中心和高等经济大学团队用186527张电商评价图片训练AI生成检测器。产品完全隔离的测试集上,最强模型PR-AUC达到0.9999;把合成图重新编码成真实图片常见的格式后,成绩跌到0.7254。
北京邮电大学、北京航空航天大学和清华大学研究人员发现,同一条危险请求加入结构化工具说明后,模型内部区分有害与无害输入的能力明显下降。Llama的AUROC从0.927降至0.740,Qwen从0.901降至0.786,Mistral从0.9
Salesforce AI Research构建了2008段合成长对话,测试四款模型在85至130个会话中能否保持角色、边界、价值观和表达风格,同时记住长期发生的事件。没有一种模型与记忆配置在所有指标上都稳定领先。
亚马逊研究人员让人类和五款大模型在相同条件下回答一次,再阅读自己或他人的答案进行第二次修改。人类在三项任务上整体提高,多数模型却没有稳定获益;面对电影评分这类主观任务,五款模型的第二次结果全部变差。
中国科学院软件研究所与腾讯微信AI团队研究了大模型的“无效推理”:题目超过能力范围时,模型仍生成很长、表面完整却含有关键错误的推导。Qwen3-8B经过CaRL训练后,Countdown任务的无效推理率从65.5%降至7%,准确率由59.6
蚂蚁集团团队提出MAGA,把分别擅长手机、桌面和网页操作的GUI智能体蒸馏到同一个Qwen3-VL模型中。8B版本在三套基准上的平均成功率为51.2%,比论文中最强的统一模型基线高2个百分点,接近三个领域教师模型50.9%的平均水平。
印度理工学院孟买分校与Adobe Research提出PTP,只读取大模型输出文本,就尝试重建产生这段回答的原始提示词。Qwen3-0.6B Chat实验中,提示词精确匹配指标达到64.77;换到跨模型和跨分词器设置后,精确恢复明显下降。
香港科技大学、浙江大学、香港中文大学和斯坦福大学团队发布FlexComposer。用户提供背景视频、前景图片或视频,再画一条移动轨迹,模型会把素材放进场景,同时生成遮挡、光照、阴影和反射变化。