90书院(90shuyuan.com)更新快,无弹窗!
《AttentionIsAllYouNeed》。
这篇全英文的预印本学术论文,在深夜十一点被上传到了arXiv平台。
没有新闻发布会,也没有官方帐号的预热宣传。
最先发现这篇论文的,是几个长期盯着九天实验室动态的自媒体帐号。
他们把论文的标题和摘要截图,直接发到了引力社区和回音平台上。
配文非常简短。
【九天实验室放出了天问大模型的底层架构论文。】
消息刚一发出去,底下的评论区就涌入了大批等待吃瓜的网友。
白天关于天问大模型造假的阴谋论满天飞,大家都等着看回响科技怎么应对。
面对满屏的英文字母和复杂的数学公式,普通网友完全摸不着头脑。
【有没有课代表来总结一下,这东西到底讲了什么?】
【全是大写字母和看不懂的网络拓扑图,这该不会是随便发一篇水文来糊弄人的吧。】
【散了吧,估计是临时拼凑的材料,想敷衍白天的造假指控。】
【连个中文翻译都没有,这是心虚了吧。】
质疑的声音还在继续增加。
十几分钟后,引力社区的一位认证大V发文了。
他的认证头衔是「前某度深度学习实验室高级算法研究员」。
这位大V没有配图,而是直接发了一篇将近四千字的纯文本长文。
文章的开头只有乾巴巴的一句话。
「别吵了,回响科技这次直接把AI界的桌子给掀了。」
这句话立刻吸引了数以十万计的流量。
大V在文章里使用了非常通俗的语言,对这篇论文的核心内容进行了拆解。
他解释了传统自然语言处理的痛点。
过去的算法依靠循环神经网络,处理文本必须按照词汇的先后顺序一个一个读取。
这种处理方式不仅计算速度慢,而且句子一旦过长,模型就会忘掉前面的设定。
这导致长文本生成经常出现前言不搭后语的问题。
大V在文章中加粗了一段文字。
「但这篇论文提出了一种全新的Transformer架构,他们直接抛弃了传统的循环和卷积网络。」
「他们提出了一种自注意力机制。」
「这种机制允许模型在处理一个词时,同时计算句子中所有其他词与它的关联度。」
「简单来说,它能在一眼之间看清整个句子的全局逻辑。」
「这解释了白天在展示现场,天问为什么能精准执行长达几百字丶带有多重嵌套条件的复杂指令。」
文章发布后,相关的从业人士纷纷下场。
引力社区的热榜排名开始发生剧烈变化。
不少国内一线网际网路大厂的算法工程师在评论区留言。
【我刚才照着论文里的公式手推了一遍,逻辑完全闭环,没有技术死角。】
【难怪生成速度那么快,这种架构天然支持矩阵运算,算力利用率是传统架构的好几倍。】
【作为同行,我必须承认,这是一篇能够改写教科书的开创性论文。】
【白天那些造谣后台有人工回复的博主呢?出来走两步?】
【这东西如果真能大规模跑通,现有的自然语言处理技术全得推倒重来。】
舆论的风向彻底逆转。
那些质疑造假的营销号集体陷入了沉默,许多帐号开始连夜删除之前的黑稿。
如果说国内的网际网路圈子只是感到震惊,那海外的AI学术界感受到的就是恐慌。
此刻的北美正值白天。
矽谷的几大科技巨头内部,各大AI实验室的邮件系统已经处于过载状态。
位于加州山景城的谷歌总部,GoogleBrain深度学习实验室里,气氛压抑得令人窒息。
高级研究员理察紧盯着电脑屏幕,端咖啡杯的手正止不住地颤抖。
五分钟前,他收到了史丹福大学一位同行发来的arXiv论文连结。
只看完了《AttentionIsAllYouNeed》的摘要部分,理察就感觉浑身的血液都凉了。
实验室的技术总监推开玻璃门,大步流星地走了进来,脸色铁青。
「理察,你看过那篇中国团队发出的论文了吗?」总监的声音里带着难以掩饰的焦虑。
「刚看完摘要。」理察咽了口唾沫,声音乾涩,「你们那边组织算力跑代码复现了吗?」
「已经抽调了五十个高级工程师,停掉了手里所有的非紧急项目,占用了整个云端集群的算力在跑模型验证。」
「结果怎么样?」理察紧张地站了起来。
「很不乐观。」总监双手撑在办公桌上,给出了一个极其消极的评价。
「代码复现组刚刚搭出