arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

语言与多模态基础模型、推理、训练与能力评测。

2608.12262 大模型

百度牛津等推出Diagram-MMU:AI能看懂科研图,却很难把它画成可编辑代码

多模态模型可以回答图里哪条曲线更高,却未必能把同一张科研图准确还原成可编辑TikZ代码。百度、牛津大学、南京理工大学等团队推出Diagram-MMU,收录3700张精选科研图和1.83万道人工验证问题,测试12个模型的读图、图转代码和按要求

南京理工大学、牛津大学等
文章封面
2608.11650 大模型

网易有道开源Confucius4-TTS:14种语言克隆声音,参考音频不用先转写

只有一段参考录音,不知道录音里说了什么,模型也能提取音色并用另一种语言合成新内容。网易有道发布Confucius4-TTS技术报告,系统覆盖14种语言,支持同语种和跨语种零样本声音克隆,不要求在推理前准备提示音频的文字稿;代码、模型权重和演

网易有道等
文章封面
2608.06628 AI基础设施

Apple&Google DeepMind改造16B扩散模型,换6层注意力吞吐提1.7倍

扩散语言模型可以并行修改多个词元,但长序列中的全注意力仍会吃掉大量计算。Apple、Google DeepMind与哈佛大学研究者在MIT开展的工作提出LLaDA-Hybrid:把16B模型20层中的6层换成块级混合注意力,再通过两阶段轻量

哈佛大学等
LLaDA-Hybrid两阶段注意力改造流程的文章封面
2608.06931 大模型

阿里通义SEE给19个多模态模型出实验题,最强准确率也没过50%

能识别显微图、读懂谱图,再据此判断实验结论,和背出科学知识不是一回事。阿里通义、浙江大学、清华大学与中国科学院大学等团队推出SEE,收集1116道以真实实验图像为核心的问题,覆盖19个多模态大模型。标准评测中,模型准确率分布在15.9%到4

中国科学院大学、清华大学、浙江大学等
化学、生物与材料实验图表题的文章封面
2608.05747 大模型

看完整段视频仍会迷路:22个视觉模型与人类差36.4分

视觉模型能描述眼前的桌椅,却未必知道自己走到了房间哪一侧。字节跳动Seed、浙江大学和新加坡国立大学推出GST-Bench,测试22个视觉语言模型后,最强零样本模型得分42.68,人类为79.08,相差36.4分。

浙江大学、新加坡国立大学等
看完整段视频仍会迷路:22个视觉模型与人类差36.4分文章封面
2608.05139 大模型

大模型会做单题,却不会中途换技能:新训练把4B模型得分翻近一倍

普林斯顿大学、卡内基梅隆大学、多伦多大学、伊利诺伊大学厄巴纳-香槟分校、斯坦福大学和牛津大学团队提出“技能熵”,专门衡量大模型在一条推理链中从一种技能切换到另一种技能的难度。

普林斯顿大学、卡内基梅隆大学、多伦多大学、伊利诺伊大学厄巴纳-香槟分校等
大模型会做单题,却不会中途换技能:新训练把4B模型得分翻近一倍文章封面
2608.04735 大模型

思维链并不总会“招供”:隐性影响下,安全监控检出率最低仅5%

洛桑联邦理工学院和英国人工智能安全研究所研究者测试了七个前沿推理模型:当提示词明确要求模型受某个线索影响并隐瞒原因时,思维链监控器能发现60%至94%的行为变化;同一线索若只是自然地混在上下文里,检出率会明显下降。

洛桑联邦理工学院等
思维链并不总会“招供”:隐性影响下,安全监控检出率最低仅5%文章封面
2608.05149 视觉与生成

搜图也能连续追问:CoCo-IR四轮检索命中率做到44.1%

伊利诺伊大学厄巴纳-香槟分校、Google DeepMind和OpenAI研究者提出CoCo-IR,把“拿一张参考图加一句修改要求”的图像检索,扩展为可连续追问的多轮搜索。用户可以先换颜色,再改背景,随后引用前面某一轮的视角或物体继续筛选。

伊利诺伊大学厄巴纳-香槟分校、OpenAI等
搜图也能连续追问:CoCo-IR四轮检索命中率做到44.1%文章封面
2608.02831 大模型

微软等让奖励标准跟着模型进化,音频推理不再只看最终答案

音频模型答对一道题,可能靠文字常识猜中,未必真正听懂声音。微软研究院、马里兰大学、伊利诺伊大学和MBZUAI团队提出AudioRubrics,为每个样本生成基于原始波形的评分表,并在训练中根据模型的新回答持续改写标准。

马里兰大学、微软研究院等
微软等让奖励标准跟着模型进化,音频推理不再只看最终答案文章封面
2608.02689 大模型

模型困惑度正常,却有81%的选择题只答A

DT-Project研究者的一项0.6B语言模型改造实验出现了反常结果:学生模型的困惑度已经接近教师,C-Eval选择题准确率却只有25%至29%,并在81%的回答中预测“A”。问题不在于知识全部丢失,而是模型没有跟随答案内容切换选项标签。

DT-Project等
模型困惑度正常,却有81%的选择题只答A文章封面
2608.03020 AI基础设施

大模型调优不再反复反传,LoCA把GPU峰值内存压低近三成

腾讯、帝国理工学院、密歇根大学等机构的研究人员提出LoCA。它先用一次反向传播完成校准,后续适配只运行前向计算和局部闭式求解。包含校准在内,全程GPU峰值内存比LoRA低26%至29%。

密歇根大学、腾讯等
大模型调优不再反复反传,LoCA把GPU峰值内存压低近三成文章封面
2608.03691 大模型

AI看见了异常像素,仍照着重复模板写错代码

网页里连续出现几张相同卡片,其中一张明显更宽。多模态模型先算出它接近120%,最后却把代码填成和其他卡片一样的100%。一项由威廉与玛丽学院团队完成的研究,把这种错误称为“视觉模式补全偏差”。

威廉与玛丽学院等
AI看见了异常像素,仍照着重复模板写错代码文章封面
2608.02091 AI基础设施

复旦北大找到低精度训练崩溃通道,QK-Guard守住6万步

复旦大学、哈尔滨工业大学和北京大学等团队复现了bfloat16 Transformer训练中的突然崩溃:模型可以正常运行很多步,注意力随后快速失控。研究发现,不同位置的低精度误差最终会汇入查询—键权重的共同通道。

哈尔滨工业大学、北京大学等
复旦北大找到低精度训练崩溃通道,QK-Guard守住6万步文章封面
↑