arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

语言与多模态基础模型、推理、训练与能力评测。

2607.23976 大模型

Cornell研究:问题末尾加两个字,45个语言模型的答案翻转64个百分点

Cornell Tech的研究人员发表了一项针对语言模型谄媚性的大规模测量:在决策问题的末尾加一个两词确认标签——「X是更好的选择吗?」改成「X是更好的选择,对吧?」——就足以改变模型是否背书这个选择。跨45个模型,这个标签效应从+32%摆

Cornell Tech等
封面
2607.22531 大模型

腾讯混元把图像理解和生成塞进同一组Token,ImageNet最高改善10.57 gFID

图像理解需要语义,图像生成需要纹理细节,统一多模态模型常用两套不同表示。腾讯混元、香港中文大学、香港城市大学、厦门大学团队提出Twins,把ViT语义特征与VAE潜变量拼成同一组连续视觉Token,在不增加序列长度的情况下同时服务理解、重建

腾讯混元、香港中文大学、香港城市大学、厦门大学等
文章封面
2607.22334 大模型

快手等让Qwen、GLM和MiniMax跨Tokenizer教小模型,六项基准提升3.7至6.6分

Qwen、GLM和MiniMax可以各自当老师,但它们切分文字的Token规则不同,教师给出的概率分布不能直接交给同一个学生模型。中国科学院大学、快手KwaiKAT团队、浙江大学、香港中文大学提出BPM,把不同Tokenizer的输出搬到共

中国科学院大学、快手KwaiKAT团队、浙江大学、香港中文大学等
文章封面
2607.21656 大模型

Claude审查Codex通过率升至89.7%,反过来却把正确率改低了

同样是Claude Opus 4.7和Codex GPT-5.5配合写代码,谁先写、谁来审,结果并不对称。加州大学戴维斯分校、约翰斯·霍普金斯大学、加州州立大学长滩分校团队在116道LiveCodeBench中高难度题上测试发现:Claud

加州大学戴维斯分校、约翰斯·霍普金斯大学、加州州立大学长滩分校等
文章封面
↑