arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

语言与多模态基础模型、推理、训练与能力评测。

2608.00023 大模型

DeepMind与OpenAI测试275种AI角色,引导越强未必越像

Google DeepMind、OpenAI、牛津大学、佐治亚理工学院和伊利诺伊大学厄巴纳-香槟分校等机构研究人员测试了275种大模型角色。多数角色会随着激活引导增强而更贴近设定,但有38种角色在六项指标上全部下降。

佐治亚理工学院、伊利诺伊大学厄巴纳-香槟分校、牛津大学等
DeepMind与OpenAI测试275种AI角色,引导越强未必越像文章封面
2608.01078 AI基础设施

英特尔中国把推理模型压到1.58比特,校准数据少100万倍

英特尔中国研究院发布ScaleQ-1.58,把推理大模型权重压缩为三值表示。Qwen3-1.7B版本只使用400万校准Token,在4项数学和代码任务上的平均表现达到BitNet b1.58 2B4T的90.52%以上,量化所需校准Toke

英特尔中国研究院等
英特尔中国把推理模型压到1.58比特,校准数据少100万倍文章封面
2607.29254 大模型

清华等团队发现,给大模型一份工具说明可能削弱拒答信号

北京邮电大学、北京航空航天大学和清华大学研究人员发现,同一条危险请求加入结构化工具说明后,模型内部区分有害与无害输入的能力明显下降。Llama的AUROC从0.927降至0.740,Qwen从0.901降至0.786,Mistral从0.9

北京邮电大学、北京航空航天大学、清华大学等
清华等团队发现,给大模型一份工具说明可能削弱拒答信号文章封面
2607.28818 大模型

Salesforce审计2008段长对话,AI伴侣会出现人格漂移

Salesforce AI Research构建了2008段合成长对话,测试四款模型在85至130个会话中能否保持角色、边界、价值观和表达风格,同时记住长期发生的事件。没有一种模型与记忆配置在所有指标上都稳定领先。

Salesforce AI Research等
Salesforce审计2008段长对话,AI伴侣会出现人格漂移文章封面
2607.28908 大模型

亚马逊研究发现,大模型“再想一遍”经常不如人类修改

亚马逊研究人员让人类和五款大模型在相同条件下回答一次,再阅读自己或他人的答案进行第二次修改。人类在三项任务上整体提高,多数模型却没有稳定获益;面对电影评分这类主观任务,五款模型的第二次结果全部变差。

亚马逊等
亚马逊研究发现,大模型“再想一遍”经常不如人类修改文章封面
2607.29211 大模型

腾讯和中科院训练大模型“知道做不到”,无效推理率从65.5%降至7%

中国科学院软件研究所与腾讯微信AI团队研究了大模型的“无效推理”:题目超过能力范围时,模型仍生成很长、表面完整却含有关键错误的推导。Qwen3-8B经过CaRL训练后,Countdown任务的无效推理率从65.5%降至7%,准确率由59.6

中国科学院软件研究所等
腾讯和中科院训练大模型“知道做不到”,无效推理率从65.5%降至7%文章封面
2607.29378 大模型

只看模型回答也能反推提示词,Adobe团队公布PTP方法

印度理工学院孟买分校与Adobe Research提出PTP,只读取大模型输出文本,就尝试重建产生这段回答的原始提示词。Qwen3-0.6B Chat实验中,提示词精确匹配指标达到64.77;换到跨模型和跨分词器设置后,精确恢复明显下降。

印度理工学院孟买分校等
只看模型回答也能反推提示词,Adobe团队公布PTP方法文章封面
2607.28627 大模型

微软与DeepMind团队只加一个Token,视觉检索提高13.4分

伊利诺伊大学厄巴纳-香槟分校、微软研究院和Google DeepMind研究人员提出ReToken,通过一个可学习的检索Token,从大量图片或长视频帧中筛选与问题相关的视觉信息。

伊利诺伊大学厄巴纳-香槟分校、微软研究院等
微软与DeepMind团队只加一个Token,视觉检索提高13.4分文章封面
2607.28263 AI基础设施

清华腾讯提出CoMem,128K上下文显存降至18.26GB

清华大学与腾讯提出长上下文记忆方法CoMem。在单张96GB英伟达H20上处理128K上下文时,一组不使用适配器的效率测试显示,峰值显存由完整上下文方案的89.36GB降至18.26GB,预填充时间由15.014秒缩短到1.917秒,加速7

清华大学、腾讯等
清华腾讯提出CoMem,128K上下文显存降至18.26GB文章封面
2607.28466 更多前沿

复旦浙大微软用28万份肠镜报告训练医疗AI

复旦大学、浙江大学、帝国理工学院和微软亚洲研究院等机构发布肠镜视觉语言模型EndoCLIP。团队从280476份常规肠镜记录中恢复出125756组病灶图文配对,用医生日常书写的报告替代昂贵的逐帧人工标注。

浙江大学、微软亚洲研究院等
复旦浙大微软用28万份肠镜报告训练医疗AI文章封面
2607.28607 大模型

Google团队发现,压制AI意识自述会连带改变价值回答

让大模型避免声称自己“有意识”,是当前AI安全训练中的常见目标。Google Paradigms of Intelligence团队与多所高校的一项研究发现,这类约束可能同时压低模型对动物、自然物和技术物体的心智归因,并改变它在宗教、道德和

Google Paradigms of Intelligence团队等
Google团队发现,压制AI意识自述会连带改变价值回答文章封面
2607.28617 大模型

88款商业AI提示词被审计,四成产品出现用户利益冲突

88款商业AI产品的系统提示词被放在同一套标准下审查。研究团队共检查3249条开发者指令,约40%的产品至少含有一条损害用户利益的要求,只有23.9%的产品覆盖全部八项用户保护维度。

斯坦福大学、卡内基梅隆大学、麻省理工学院、牛津大学等
88款商业AI提示词被审计,四成产品出现用户利益冲突文章封面
2607.28627 大模型

UIUC、微软、DeepMind提出ReToken:一个可学习token让视觉检索大涨13个点

把上百张图片或一小时长的视频塞给视觉语言模型,答案明明就在某一帧里,模型却常常答不对。上下文越长,干扰画面越多,成绩掉得越厉害;而把整段视觉序列全量处理,显存又先撑不住,全量微调的成本更是高昂。伊利诺伊大学厄巴纳-香槟分校(UIUC)联合微

伊利诺伊大学厄巴纳-香槟分校、微软研究院、谷歌DeepMind等
文章封面
2607.28466 更多前沿

复旦等用28万份肠镜报告训练AI,良恶性判断接近内镜医师水平

肠镜报告里写清了病灶的部位、大小和形态,却几乎不会注明这些描述对应检查中的哪一帧画面。复旦大学(附属中山医院)联合浙江大学、微软亚洲研究院、曼彻斯特大学等机构提出EndoCLIP,一个面向结肠镜检查的视觉语言基础模型:它直接复用医院档案库中

复旦大学、浙江大学、微软亚洲研究院、曼彻斯特大学等
文章封面
2607.26410 大模型

NVIDIA提出Voice Memory:用「克制」策略降低语音识别错误率

英伟达(NVIDIA)提出了Voice Memory,一种仅推理的语音识别纠错方案。核心思路不是让模型更聪明,而是让它在"什么时候该改、什么时候不该改"上做得更好。在10个领域的测试中,Voice Memory将加权词错误率从8.36%降至

英伟达等
封面
2607.26886 大模型

CMU&亚马逊研究:Claude、GPT无图也编造诊断,66%的虚构还会同时承认「没图」

当被要求描述一张从未提供的医学图像时,前沿视觉语言模型不会弃权,而是会编造诊断结果。更关键的是,这些编造不是随机的——它高度依赖于患者的人口统计学特征。卡内基梅隆大学和亚马逊云科技的研究人员发现了这一现象,测试涉及Claude Opus-4

卡内基梅隆大学、亚马逊云科技等
封面
2607.22864 大模型

NVIDIA&耶鲁发布Spatial-IQ:把空间智能拆成9个子能力逐项考试

NVIDIA研究院和耶鲁大学的研究人员发表了Spatial-IQ,一个分层诊断框架,把堆叠三维结构中的物体计数拆成9个感知与认知子任务,按人类空间认知的发育阶段组织,外加心理旋转作为补充探针。诊断结论直白:最好的模型Qwen在人类基线任务上

NVIDIA研究院、耶鲁大学等
封面
2607.23806 大模型

一个冻结的12B模型考了180/180满分:零token、位精确、永远如此

Corbenic AI发表了一份行业经验报告,描述了一套与主流路线相反的系统:模型保持冻结,一旁的持久记忆存储已验证的解法。问题族一旦被解决并通过不接触答案密钥的独立验证,该族每个新实例都由记忆直接应答——零生成token、位精确、确定性。

Corbenic AI等
封面
↑