百度牛津等推出Diagram-MMU:AI能看懂科研图,却很难把它画成可编辑代码
多模态模型可以回答图里哪条曲线更高,却未必能把同一张科研图准确还原成可编辑TikZ代码。百度、牛津大学、南京理工大学等团队推出Diagram-MMU,收录3700张精选科研图和1.83万道人工验证问题,测试12个模型的读图、图转代码和按要求
多模态模型可以回答图里哪条曲线更高,却未必能把同一张科研图准确还原成可编辑TikZ代码。百度、牛津大学、南京理工大学等团队推出Diagram-MMU,收录3700张精选科研图和1.83万道人工验证问题,测试12个模型的读图、图转代码和按要求
只有一段参考录音,不知道录音里说了什么,模型也能提取音色并用另一种语言合成新内容。网易有道发布Confucius4-TTS技术报告,系统覆盖14种语言,支持同语种和跨语种零样本声音克隆,不要求在推理前准备提示音频的文字稿;代码、模型权重和演
一个模型扮演游戏角色得82分,究竟是忘了世界观、说错人物关系,还是没有完成玩家交代的目标?快手GameMind Lab开源TRACE Bench,把角色设定提前拆成固定检查表,再用用户Agent对话并保存逐轮证据。它在更少对话轮次中覆盖99
Meta AI、普林斯顿和MIT提出Gambit,把大模型的测试时推理改成“思维层面的束搜索”。它不再让大量推理轨迹各自跑到底,而是周期性砍掉低质量路径,把释放的算力立即用来复制更好的思路前缀。
Google Research和Google DeepMind把医疗对话系统AMIE扩展到实时视频问诊。新系统能在交谈时分析声音和画面,记录动作、表情与身体观察,再将这些信息纳入诊断和处置。
扩散语言模型可以并行修改多个词元,但长序列中的全注意力仍会吃掉大量计算。Apple、Google DeepMind与哈佛大学研究者在MIT开展的工作提出LLaDA-Hybrid:把16B模型20层中的6层换成块级混合注意力,再通过两阶段轻量
能识别显微图、读懂谱图,再据此判断实验结论,和背出科学知识不是一回事。阿里通义、浙江大学、清华大学与中国科学院大学等团队推出SEE,收集1116道以真实实验图像为核心的问题,覆盖19个多模态大模型。标准评测中,模型准确率分布在15.9%到4
给时间序列模型检索历史案例,曲线形状相似却可能高低不同、时间错位,直接塞进上下文反而会误导预测。斯坦福大学与亚马逊提出Align-RAG,用两个免训练变换先对齐振幅和相位。
模型同时收到视频、音频、图片和文字,文字若与其他证据冲突,它常直接跟着文字回答。微软研究院印度分院与IIIT Hyderabad推出C3PO基准,最佳模型准确率73.17%,人类为88.64%。
视觉模型能描述眼前的桌椅,却未必知道自己走到了房间哪一侧。字节跳动Seed、浙江大学和新加坡国立大学推出GST-Bench,测试22个视觉语言模型后,最强零样本模型得分42.68,人类为79.08,相差36.4分。
普林斯顿大学、卡内基梅隆大学、多伦多大学、伊利诺伊大学厄巴纳-香槟分校、斯坦福大学和牛津大学团队提出“技能熵”,专门衡量大模型在一条推理链中从一种技能切换到另一种技能的难度。
洛桑联邦理工学院和英国人工智能安全研究所研究者测试了七个前沿推理模型:当提示词明确要求模型受某个线索影响并隐瞒原因时,思维链监控器能发现60%至94%的行为变化;同一线索若只是自然地混在上下文里,检出率会明显下降。
伊利诺伊大学厄巴纳-香槟分校、Google DeepMind和OpenAI研究者提出CoCo-IR,把“拿一张参考图加一句修改要求”的图像检索,扩展为可连续追问的多轮搜索。用户可以先换颜色,再改背景,随后引用前面某一轮的视角或物体继续筛选。
斯坦福大学等机构推出DelusionEval,用经历过妄想和心理伤害的用户对话测试聊天机器人。评测包含18名参与者、589段对话历史和12591条消息,观察模型是否迎合妄想、夸大自身能力、制造亲密关系,或未能劝阻自伤与暴力。
音频模型答对一道题,可能靠文字常识猜中,未必真正听懂声音。微软研究院、马里兰大学、伊利诺伊大学和MBZUAI团队提出AudioRubrics,为每个样本生成基于原始波形的评分表,并在训练中根据模型的新回答持续改写标准。
DT-Project研究者的一项0.6B语言模型改造实验出现了反常结果:学生模型的困惑度已经接近教师,C-Eval选择题准确率却只有25%至29%,并在81%的回答中预测“A”。问题不在于知识全部丢失,而是模型没有跟随答案内容切换选项标签。
腾讯、帝国理工学院、密歇根大学等机构的研究人员提出LoCA。它先用一次反向传播完成校准,后续适配只运行前向计算和局部闭式求解。包含校准在内,全程GPU峰值内存比LoRA低26%至29%。
网页里连续出现几张相同卡片,其中一张明显更宽。多模态模型先算出它接近120%,最后却把代码填成和其他卡片一样的100%。一项由威廉与玛丽学院团队完成的研究,把这种错误称为“视觉模式补全偏差”。
腾讯混元公布Hunyuan3D-Buffalo 1.0,把3D问答与定位、文本生成3D、指令编辑3D和指定部件生成放进同一套架构。训练语料总规模为8700万条,包括2500万理解样本、5000万文本到3D配对和1200万编辑配对。
复旦大学、哈尔滨工业大学和北京大学等团队复现了bfloat16 Transformer训练中的突然崩溃:模型可以正常运行很多步,注意力随后快速失控。研究发现,不同位置的低精度误差最终会汇入查询—键权重的共同通道。