微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 牛津大学脑机接口团队发布史上最大规模MEG语音解码数据集:一个人的80小时,如何撬动整个领域

牛津大学脑机接口团队发布史上最大规模MEG语音解码数据集:一个人的80小时,如何撬动整个领域

2026-09-22 12:48
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-09-22 12:48 • 科技行者

2024年,一台植入式脑机接口设备让一位瘫痪多年的患者重新"开口说话",词错误率低于5%,比很多语音识别软件还准。这听起来像科幻电影,但代价是要在脑子里动手术,植入电极。这条路能救人,却没法普及。真正的希望在另一条路上:不开颅、不动刀,只靠戴在头上的设备读懂大脑信号。这条路走得慢得多,而牛津大学的PNPL实验室觉得,慢的原因之一,是这个领域一直没有一个像样的"共同题库"。

你可能没意识到,计算机视觉能在过去十年突飞猛进,一个被低估的原因是ImageNet的出现。

在ImageNet之前,不同实验室各自收集小规模数据、各自定义评测标准,谁也说不清哪个方法真的更强。ImageNet给了所有人同一套题目、同一把尺子。脑机接口领域,尤其是非侵入式的那部分,至今没有这样一把尺子。牛津团队这次发布的LibriBrain100,想做的正是这件事。

先说清楚这个数据集在测什么。它记录的是脑磁图信号,英文缩写MEG。

MEG*:全称脑磁图(magnetoencephalography),一种非侵入式脑成像技术,通过头皮外的超导传感器捕捉大脑神经活动产生的微弱磁场,不需要开颅,受试者只需戴上一个像头盔一样的设备。

具体的实验场景是:让志愿者戴着这个"头盔",听有声书、听新闻播客、听经过语音学设计的句子,同时记录他们大脑的磁场变化。研究者想知道,能不能从这些磁场信号里,反推出这个人当时听到的是哪个词。这个任务叫词分类。

一件事的规模,决定了它能撬动多大的杠杆

这个数据集最引人注目的数字是:一个人贡献了将近80个小时的脑磁图数据。

这不是笔误。研究团队把这个人称为"0号受试者",让他反复来实验室录了将近80小时的脑活动记录,是此前同类数据集里最深纪录的8倍,是绝大多数同类数据集的80倍。

这里有个问题必须先解释清楚:为什么要死磕一个人的数据量,而不是多找些人分摊时间?

答案藏在此前一系列研究的发现里。2025年发表在《自然-通讯》上的一篇论文做了个对比实验:同样的总录制时长,分给很多人录一点点,还是集中在少数人身上录很多,哪种效果更好?结果是后者碾压前者。一个录了10小时的单人数据集,解码效果显著超过总时长更长但分散在几十个人身上的数据集。

这背后的道理其实不难理解。每个人的大脑长得不完全一样,脑区位置、信号强弱、噪声模式都有个体差异。如果你想让一个模型学会从某个人的脑电信号里读出词义,你需要给它足够多这个人的样本,让它把这个人的"信号方言"学透。你今天录10分钟,明天换一个人再录10分钟,模型永远在学新方言,学不精。

打个比方,这就像你想学会听懂一个人的口音。如果你和这个人朝夕相处一整年,你会越来越熟悉他说话的节奏、习惯、含糊不清的地方。但如果你每天换一个陌生人聊十分钟,一年下来你接触的人更多,但你对任何一个人的口音都停留在"刚认识"的阶段。如果不集中在少数人身上积累深度数据,模型学到的永远是浅层的、泛化性差的东西,这正是为什么团队宁可让一个人重复来实验室几十次,也不愿意分散精力多找几十个人各录一点。

原来的LibriBrain数据集(可以理解成LibriBrain100的上一代版本)已经做到了单人50多小时,这次的LibriBrain100把这个数字推到了80小时,并且把整套福尔摩斯探案集九本书全部读完(上一版只读了七本),同时加入了两类新素材:一是专为控制语音学变量设计的TIMIT和MOCHA-TIMIT语料库,二是30期播客故事。

TIMIT*:一套专门为语音识别研究设计的美式英语语料库,句子经过精心挑选,让每个音素(也就是英语里最小的发音单位,比如"b""t""ee"这些)出现的频率尽量均衡,常被用来研究大脑如何处理具体的发音细节。

MOCHA-TIMIT*:TIMIT的英式英语版本,增加了男女两位英国口音说话人的录音,同样服务于语音学层面的精细分析。

为什么要额外加这两个语料库?因为福尔摩斯探案集虽然量大,但题材单一,反复读九本侦探小说,听多了会发现语言风格、词汇分布高度重复。这样的数据能训练模型识别"这个人在这种叙事风格下大脑是什么反应",但没法回答"大脑对不同发音方式的敏感度"或者"大脑如何处理陌生的语义内容"这类问题。TIMIT和MOCHA-TIMIT专门控制了音素分布,播客则带来了从津巴布韦独立到战时巴格达、从丧亲之痛到科学考察等五花八门的话题,补上了语义多样性这一课。

一个人不够,32个人来凑

深度数据固然重要,但现实世界里,你不可能要求每个想用脑机接口的人先来实验室躺80个小时。这在临床应用上完全不现实,病人没有这个精力,医院也没有这个资源。

于是团队做了第二件事:找来32位新的志愿者,每人只录了大约40分钟。这构成了数据集的"广度"部分,和0号受试者的"深度"部分形成互补。

这个设计思路,其实很像手机厂商做AI语音助手的策略。厂商不可能让每个用户先对着手机说满100个小时的话来"训练专属模型",那样没人会买账。他们的做法通常是先用海量通用语料训练出一个大模型,让新用户只需要说几句话做"个性化微调",体验就能大幅提升。如果没有这个大模型打底,每个新用户从零开始训练,效果会差很多,而且门槛高到没人愿意用。LibriBrain100里那80小时的深度数据,扮演的正是这个"打底大模型"的角色,32人的浅层数据则是用来验证:有了这个底子,新用户只需要很少的数据就能被识别。

这套组合拳到底管不管用?团队用一个叫MEG-XL的预训练模型做了三组实验来验证。

MEG-XL*:一个先在多个数据集(包括约300小时、800名受试者的脑电和脑磁数据)上预训练,再针对具体任务做微调的语音解码模型,借鉴了大语言模型"先海量预训练、后小样本微调"的思路。

第一组实验测的是:把32个新人的数据也拿来一起训练,对0号受试者自己的解码效果有没有帮助?结果有点意思,在听有声书这个任务上,加入32人数据后,准确率从52.5%(相当于79万比特每词左右,这里简化成百分比表述)提升到58.5%;但如果测试的是TIMIT这种控制过的语音材料,加进32人数据反而效果更好,准确率从39.3%提升到43.1%。唯独在有声书这个任务上,如果只用0号受试者自己的福尔摩斯数据训练,反而比加入32人数据表现更好一点点,达到49.2%,不过差距很小。

这说明什么?说明"用别人的数据帮自己"这件事不是无脑加法,得看任务性质。福尔摩斯小说这种高度个性化、风格固定的素材,0号受试者自己的历史数据已经足够精准地刻画这种模式,别人的数据反而可能引入一些"噪声"或者说是不完全对齐的模式。但在TIMIT这种更标准化、跨说话人共性更强的任务上,多样化的训练数据反而能帮模型学到更稳健的规律。

第二组实验反过来测:0号受试者的80小时深度数据,能不能反哺32个新人,让新人的解码效果变好?

结果非常干脆。加入0号受试者数据训练后,32人的平均准确率是47.8%,不加入则只有32.9%,整整差了15个百分点。而且这个提升在32个人身上几乎是普遍现象,不是靠某几个"天赋异禀"的受试者拉高平均值。

这15个百分点意味着什么?意味着如果不用0号受试者的深度数据打底,新用户每猜10次里大概能猜对3次多一点;而用了这个底子之后,10次里能猜对将近5次。对一个想靠脑机接口交流的人来说,这个差距可能就是"勉强能用"和"根本没法用"的区别。

第三组实验更进一步追问:能不能把32人身上需要的数据量继续压缩,压到10分钟左右,还能不能保持效果?

团队把32人分成三组,第一组用100%的可用训练数据微调,第二组只用50%,第三组只用25%(大约相当于10分钟)。结果显示,三组的解码准确率几乎没有差别,分别是49.2%、48.8%、48.2%。真正拉开差距的,始终是"有没有加入0号受试者的数据",而不是"新用户自己录了多少分钟"。

这个结果如果成立,对未来的临床应用是个好消息。如果一个瘫痪患者只需要贡献10分钟左右的脑活动数据,就能获得接近于用了几十分钟数据的解码效果,那对患者的负担会小很多。当然,团队在论文里也很谨慎地提醒,这些数据全部来自健康志愿者听讲的场景,离真正给病人用还有距离。

顺带一提,团队还用一种叫OVMI的信息论指标,把这套非侵入式方案和2021年一个真正用在瘫痪患者身上的植入式脑机接口做了对比。

OVMI*:一种衡量脑机接口"信息传输效率"的指标,单位是每次尝试传递多少比特信息,数值越高说明这套系统能更快、更准地把使用者的意图转化成可理解的输出。

植入式方案那边измеряется出的数值是0.259比特每词尝试,而这次非侵入式的MEG-XL模型是0.075,如果换成专门优化过的词汇表能到0.147。差距还很大,但团队也坦承,这个对比只是个参照系,毕竟一边测的是"听懂了什么词",另一边测的是真正的"意图表达",不是同一件事。这更像是给整个领域立一个路标:我们现在走到哪儿了,离那个植入式的里程碑还有多远。

数据从哪来,又能怎么用

聊了这么多实验结果,回到最基础的问题:这些数据长什么样,普通研究者要怎么拿到手用?

原始数据是306个传感器同时记录、每秒采样1000次的脑磁场信号,经过降采样处理后变成每秒250次,这个降采样保留了高伽马频段(70到125赫兹)的振荡信息,这个频段被认为和语言处理密切相关。数据配有详细的时间标注文件,精确到每个词、每个音素的起止时间点,这样研究者才能把"某个时间点的脑活动"和"当时正在听的具体词语"对应起来。

为了让这套流程真正可用,团队专门做了一个叫pnpl的Python工具库,一行pip install pnpl就能装上,内置了下载、预处理、按需筛选数据的功能,连深度学习框架需要的数据格式都封装好了。这个细节其实很重要,因为一个数据集如果只是扔在网上一堆文件,真正能用起来的研究者会少很多。工具链完善,才能真正降低门槛。

整个标注工作花了超过200个小时的人工核对,先用自动化的语音活动检测和强制对齐工具打底,再人工逐条修正边界不准的地方,尤其是人名、外语引用、口语中的重复和修正这些自动化工具容易出错的地方。这种"机器打草稿、人工精修"的模式,某种程度上很像现在很多AI数据标注的常见做法,只不过这里标的不是图片里的猫和狗,而是脑磁波形里每一个词的起止时刻。

写在后面

看完这份工作,我印象最深的一点不是那80小时的数据量,而是那15个百分点的对比实验。它其实在回答一个更根本的问题:一个人的深度经验,到底能不能被"打包"送给另一个几乎没有经验的人?

在人类社会里,这个问题有很多现成的答案,老师傅带徒弟、老中医传方子、老司机教新手上路,靠的都是经验的迁移,而不是每个人从零开始摸索。这次实验用数字证明了同样的逻辑在大脑信号解码上也成立:一个人攒下的80小时经验,能实实在在地帮另一个只花了10分钟的人,把准确率从32.9%拉到47.8%。这不是一句励志的比喻,是一组真实测出来的数字。

另一个让我反复想的细节是,团队特意提到,他们同时也在收集"内心默念"而不是"听声音"的数据,准备在未来发布。这提醒我们,LibriBrain100测的其实是相对容易的场景,人听懂了一句话,大脑的反应本来就比较清晰、信噪比高。真正难的是让一个人默默地"想"一句话,或者尝试发声却发不出来,这才是瘫痪患者真正需要的场景。这份数据集是一块扎实的地基,但离真正的"意念打字",中间还隔着一段没人走完的路。

Q&A

Q1:LibriBrain100数据集是什么?

A:LibriBrain100是牛津大学团队发布的大规模脑磁图(MEG)数据集,总时长超过100小时,其中一位受试者贡献了约80小时的深度数据,另外32位受试者各贡献约40分钟,专门用于研究非侵入式脑机接口的语音解码,数据来自志愿者听有声书、播客和语音学语料库时的脑活动记录。

Q2:为什么要让一个人录80小时数据,而不是找更多人分摊时间?

A:研究发现单人深度数据比分散在多人身上的浅层数据解码效果更好,因为每个人大脑信号存在个体差异,模型需要足够多同一个人的样本才能精准学习其"信号特征",实验证实用0号受试者数据打底后,新用户解码准确率提升了15个百分点。

Q3:这份数据集离真正能用的脑机接口还有多远?

A:目前还有距离。这份数据记录的是"听懂语音"时的脑活动,信噪比较高,而真正的脑机接口需要解码"内心默念"或"尝试发声却发不出来"的场景,难度更大,团队表示正在收集这类数据,未来会陆续发布。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-