arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2608.02091 AI基础设施

复旦北大找到低精度训练崩溃通道,QK-Guard守住6万步

复旦大学、哈尔滨工业大学和北京大学等团队复现了bfloat16 Transformer训练中的突然崩溃:模型可以正常运行很多步,注意力随后快速失控。研究发现,不同位置的低精度误差最终会汇入查询—键权重的共同通道。

哈尔滨工业大学、北京大学等
复旦北大找到低精度训练崩溃通道,QK-Guard守住6万步文章封面
2608.00803 更多前沿

康奈尔用超声眼镜读取无声说话,词汇量扩到5356个

康奈尔大学发布SoniSpeech,用带超声传感器的眼镜采集无声说话时的面部运动。数据集包含34小时、18000条话语和5356个独立单词,基线模型在开放词汇无声语音识别中的词错误率为26.3%。

康奈尔大学等
康奈尔用超声眼镜读取无声说话,词汇量扩到5356个文章封面
2608.01452 具身智能与机器人

斯坦福中大让机器人看一次静态示范,学习抓移动物体

中山大学、斯坦福大学和东南大学团队发布DynamicManip,只用一次静态任务示范生成多种动态操作训练数据。与对照方法相比,系统在论文任务上的平均成功率提高18.4个百分点,策略查询延迟降低32.9%。

中山大学、斯坦福大学、东南大学等
斯坦福中大让机器人看一次静态示范,学习抓移动物体文章封面
2608.02603 视觉与生成

20个世界模型参加反应力考试,视频逼真不代表世界会回应

中国科学院自动化研究所、香港中文大学、清华大学等团队发布WorldExam,用1474个案例评测20个可控视频与世界模型。没有一款模型同时覆盖大量任务并保持稳定高表现,画质好、指令完成度高,也不保证场景会作出合理反应。

中国科学院自动化研究所、香港中文大学、清华大学等
20个世界模型参加反应力考试,视频逼真不代表世界会回应文章封面
2608.01942 视觉与生成

剑桥南洋理工给7款视频模型出文化考题,漂亮不等于懂

南洋理工大学、剑桥大学、新加坡管理大学和CentraleSupélec团队发布CultureVidBench,用1000条提示测试7款文本生成视频模型。结果显示,模型能生成语义相符、画质不错的视频,却常把服饰、文字、仪式步骤和声音线索做错。

南洋理工大学、新加坡管理大学、剑桥大学等
剑桥南洋理工给7款视频模型出文化考题,漂亮不等于懂文章封面
2608.00023 大模型

DeepMind与OpenAI测试275种AI角色,引导越强未必越像

Google DeepMind、OpenAI、牛津大学、佐治亚理工学院和伊利诺伊大学厄巴纳-香槟分校等机构研究人员测试了275种大模型角色。多数角色会随着激活引导增强而更贴近设定,但有38种角色在六项指标上全部下降。

佐治亚理工学院、伊利诺伊大学厄巴纳-香槟分校、牛津大学等
DeepMind与OpenAI测试275种AI角色,引导越强未必越像文章封面
2608.01078 AI基础设施

英特尔中国把推理模型压到1.58比特,校准数据少100万倍

英特尔中国研究院发布ScaleQ-1.58,把推理大模型权重压缩为三值表示。Qwen3-1.7B版本只使用400万校准Token,在4项数学和代码任务上的平均表现达到BitNet b1.58 2B4T的90.52%以上,量化所需校准Toke

英特尔中国研究院等
英特尔中国把推理模型压到1.58比特,校准数据少100万倍文章封面
2608.02580 具身智能与机器人

阿里通义把人类视频变成18561小时机器人训练数据

阿里巴巴通义千问、中国人民大学、上海科技大学、北京通用人工智能研究院和北京航空航天大学团队发布Ego2Robot,把人类佩戴相机拍下的第一视角操作视频转换为机器人训练数据。整套数据达到18561小时,覆盖15种机器人形态。

上海科技大学、北京通用人工智能研究院、北京航空航天大学等
阿里通义把人类视频变成18561小时机器人训练数据文章封面
2607.29581 视觉与生成

AI图片检测器拿到0.9999高分,实际可能只认出了文件格式

俄罗斯Sirius教育中心和高等经济大学团队用186527张电商评价图片训练AI生成检测器。产品完全隔离的测试集上,最强模型PR-AUC达到0.9999;把合成图重新编码成真实图片常见的格式后,成绩跌到0.7254。

高等经济大学等
AI图片检测器拿到0.9999高分,实际可能只认出了文件格式文章封面
2607.29254 大模型

清华等团队发现,给大模型一份工具说明可能削弱拒答信号

北京邮电大学、北京航空航天大学和清华大学研究人员发现,同一条危险请求加入结构化工具说明后,模型内部区分有害与无害输入的能力明显下降。Llama的AUROC从0.927降至0.740,Qwen从0.901降至0.786,Mistral从0.9

北京邮电大学、北京航空航天大学、清华大学等
清华等团队发现,给大模型一份工具说明可能削弱拒答信号文章封面
2607.28818 大模型

Salesforce审计2008段长对话,AI伴侣会出现人格漂移

Salesforce AI Research构建了2008段合成长对话,测试四款模型在85至130个会话中能否保持角色、边界、价值观和表达风格,同时记住长期发生的事件。没有一种模型与记忆配置在所有指标上都稳定领先。

Salesforce AI Research等
Salesforce审计2008段长对话,AI伴侣会出现人格漂移文章封面
2607.28908 大模型

亚马逊研究发现,大模型“再想一遍”经常不如人类修改

亚马逊研究人员让人类和五款大模型在相同条件下回答一次,再阅读自己或他人的答案进行第二次修改。人类在三项任务上整体提高,多数模型却没有稳定获益;面对电影评分这类主观任务,五款模型的第二次结果全部变差。

亚马逊等
亚马逊研究发现,大模型“再想一遍”经常不如人类修改文章封面
2607.29211 大模型

腾讯和中科院训练大模型“知道做不到”,无效推理率从65.5%降至7%

中国科学院软件研究所与腾讯微信AI团队研究了大模型的“无效推理”:题目超过能力范围时,模型仍生成很长、表面完整却含有关键错误的推导。Qwen3-8B经过CaRL训练后,Countdown任务的无效推理率从65.5%降至7%,准确率由59.6

中国科学院软件研究所等
腾讯和中科院训练大模型“知道做不到”,无效推理率从65.5%降至7%文章封面
2607.29320 Agent

蚂蚁把手机、电脑和网页智能体合成一个,平均成功率51.2%

蚂蚁集团团队提出MAGA,把分别擅长手机、桌面和网页操作的GUI智能体蒸馏到同一个Qwen3-VL模型中。8B版本在三套基准上的平均成功率为51.2%,比论文中最强的统一模型基线高2个百分点,接近三个领域教师模型50.9%的平均水平。

蚂蚁集团等
蚂蚁把手机、电脑和网页智能体合成一个,平均成功率51.2%文章封面
2607.29378 大模型

只看模型回答也能反推提示词,Adobe团队公布PTP方法

印度理工学院孟买分校与Adobe Research提出PTP,只读取大模型输出文本,就尝试重建产生这段回答的原始提示词。Qwen3-0.6B Chat实验中,提示词精确匹配指标达到64.77;换到跨模型和跨分词器设置后,精确恢复明显下降。

印度理工学院孟买分校等
只看模型回答也能反推提示词,Adobe团队公布PTP方法文章封面
2607.29627 视觉与生成

一张产品图塞进视频还能跟着路线跑,FlexComposer公布结果

香港科技大学、浙江大学、香港中文大学和斯坦福大学团队发布FlexComposer。用户提供背景视频、前景图片或视频,再画一条移动轨迹,模型会把素材放进场景,同时生成遮挡、光照、阴影和反射变化。

香港科技大学、浙江大学、香港中文大学、斯坦福大学等
一张产品图塞进视频还能跟着路线跑,FlexComposer公布结果文章封面