九名参与者听到句子后在键盘上输入,脑磁图设备连续记录大脑活动。Meta AI、巴黎高师、法国国家科学研究中心等机构据此训练Brain2Qwerty v2,在不植入电极的情况下解码自然句子,跨参与者平均词错误率达到39%。
团队共收集22000个句子,每人记录10小时;表现最好的参与者有一半句子只出现一个或更少的词错误。实验对象是健康参与者在明确听句、打字任务中的MEG信号,不能直接外推到失语或瘫痪患者的自由交流。
连续信号不再按已知按键时刻切片
过去的同步解码通常已知每次按键发生的时间,再截取对应脑信号窗口分类字符。真实脑机接口不能预先知道用户何时开始表达、一个词何时结束,因此论文把任务改成异步解码:模型从连续MEG中同时寻找事件并输出文本。
论文Figure 1:九名参与者每人记录10小时,异步编码器直接处理连续MEG,数据量与句子多样性均被单独比较。
MEG从头部外部测量神经活动产生的磁场,避免手术,但信号弱、空间定位模糊且设备体积大。实验中的主要活动与打字时运动皮层相关,模型可能同时利用语言准备和手部运动信息,因此结果还不是“只靠想象语言”读心。
字符、单词和整句信号分三层接入
系统先用脑信号编码器预测字符序列,再用CTC分段把连续特征切成接近单词的“神经Token”。这些Token投影到Qwen3语言模型的表示空间,与字符预测一起生成最终句子。整句层表示则帮助模型保持语义方向。
论文架构图:MEG编码器产生字符和词级神经表示,再由微调后的语言模型组合成句子。
这种设计试图避免语言模型只做拼写纠错。消融实验去掉神经Token,仅把编码器文本交给同一0.6B语言模型,词错误率为0.49;加入神经Token后降至0.43,绝对改善5.6个百分点,说明词级脑信号确实改变了输出。
39%平均词错误率来自九个人的整体结果
最终模型的平均词错误率为39%,但参与者差异很大。论文同时报告字符错误率和语义错误率,并展示最佳、中位与最差参与者的句子例子。最佳参与者的“半数句子至多一个词错误”不能代表全部九人。
论文Figure 3:三种解码器在九名参与者上的错误率,以及不同表现参与者的逐句错误示例。
数据量增加时,准确率按对数线性趋势改善;句子列表更丰富也优于反复记录少量句子。这个趋势支持继续扩充数据,但不能保证仅靠规模就追上颅内植入方案,尤其是患者数据、无打字动作和开放词汇条件会改变信号结构。
自动编码智能体也参与了模型调参
团队让三个独立编码智能体从精简配置出发,修改训练代码并搜索方案,再与Optuna的四参数搜索比较。智能体找到的配置在九名参与者测试上优于经典搜索,说明自动实验能帮助探索编码器与微调组合。
论文Figure 4:CTC分词、LoRA秩和不同Qwen3规模对词错误率的影响。
这里的智能体优化仍由固定验证集引导,并不证明系统能在临床环境中自动适配新患者。数据量只有九人,统计检验的最小双侧配对显著性也受样本量限制。
从打字实验走向沟通设备还差三步
下一步需要在不能打字的人群上记录想说、尝试说或听觉语言任务,确认模型利用的是语言相关信号而非按键运动;还要缩短每位用户10小时的校准成本,并在连续实时输入中报告延迟、误触发和无话状态。
MEG设备本身昂贵且固定,产品化还依赖更便携传感器能否保留足够信号。当前结果证明无创记录可以在受控任务中恢复完整自然句子,临床沟通价值仍要由患者实验和实时系统验证。