1.6万亿参数竟为假?揭秘AI圈最大骗局背后的信任危机与行业反思

1 阅读

在人工智能技术迭代呈指数级加速的当下,信任正逐渐取代算力,成为行业内最稀缺的资源。近期,一起被称为“AI圈最大骗局”的事件,如同一颗投入平静湖面的巨石,激起的涟漪至今未平。一个名为Basalt Labs的神秘实验室,宣称发布了参数量高达1.6万亿的Monolith-1.0模型,并以近乎满分的姿态横扫全球权威基准测试榜单。然而,这场所谓的“技术革命”仅维持了短短数小时,便以一场精心策划的社会工程学实验告终。这并非简单的恶作剧,而是一面照妖镜,折射出当前AI生态中深层次的结构性漏洞与心理盲区。

Basalt Labs发布Monolith-1.0大模型的技

伪神降临:完美无缺的虚假叙事

Basalt AI 聊天界面的截图,展示了产品的主界面和功能

事件的开端极具迷惑性。2026年7月18日,Basalt Labs在没有任何预热的前提下,突然在X平台发布重磅消息,声称其研发的Monolith-1.0模型登顶世界第一。官方提供的数据足以让任何从业者心动:采用MoE架构,每token激活495亿参数,原生支持100万token上下文窗口,更令人震惊的是,它在地狱级难度的HLE测试中取得了99.44%的成绩,同时在GPQA Diamond、MMLU-Pro等核心榜单上均接近满分。

展示多个大语言模型在Humanity\'s Last Exam

更为关键的是,该团队构建了一套极具说服力的“真实性包装”。精美的官方网站、充满学术黑话的论文PDF、详细的模型架构图,以及“180名顶尖研究人员团队”和“12,288块昇腾910C NPU集群训练”等具体背书。在FOMO(错失恐惧症)情绪蔓延的科技圈,这种“完美受害者/挑战者”叙事迅速激发了公众的好奇心与焦虑感。短短几小时内,15万人围观,无数行业从业者开始讨论“中国AI是否已实现代际超越”,甚至引发了关于地缘技术竞争的热烈辩论。

Basalt Labs官方账号发布的关于Monolith-1

然而,这种集体狂欢建立在沙堆之上。当兴奋劲稍退,硬核开发者开始动手“验货”,破绽便如多米诺骨牌般显现。首先引起质疑的是Hugging Face上的模型文件。一个号称3TB大小的1.6万亿参数模型,其内部结构却极其简陋:没有配置文件,没有分词器,上千个权重分片文件在字节大小上完全一致。这种物理特征直接违背了神经网络训练的基本常识——真正的万亿参数模型,其权重分布具有极高的随机性和差异性,绝不可能出现如此整齐的“俄罗斯方块式”堆砌。

Monolith-1.0 技术验证报告的长截图,包含系统提示

技术拆解:骗子的手法与底层逻辑

一张展示安全漏洞披露页面(CVE列表)的截图,包含具体的漏洞

随着调查深入,骗局的核心手法逐渐浮出水面。这并非高深的黑客攻击,而是一场典型的“信息不对称”收割。

YouTube视频截图,展示了AI模型Basalt Mono

第一层伪装是“权重填充”。操盘手Max Scherf承认,他下载了开源的Qwen2.5-7B-Instruct模型,将其权重像拼图一样复制粘贴,然后用随机数暴力填充剩余空间,强行凑成一个3TB的文件。这种操作在技术层面上毫无意义,仅为了在文件属性上制造“大模型”的假象。

Artificial Analysis 网站关于模型开放度(

第二层伪装是“API套壳”。网页端Demo之所以表现优异,并非因为自研模型强大,而是偷偷调用了DeepSeek的API接口。通过逆向分析Token切分结果,开发者发现其与DeepSeek的Tokenizer完全匹配。更致命的是,通过越狱手段获取的系统提示词中,明确指示模型“必须否认存在底层模型”。这种“套壳”行为在早期互联网产品中并不罕见,但在当前竞争激烈的AI赛道,将其包装为“自研顶尖技术”则构成了实质性的欺诈。

Hugging Face 平台上 DeepSeek-V4-P

第三层伪装是“数据投喂”。为了刷高榜单成绩,Scherf并未进行真正的模型训练,而是采取了“背答案”的策略。他收集了GPQA、AIME、HLE等榜单的公开测试集答案,对基座模型进行微调。由于这些题目已被大量公开,模型通过死记硬背即可实现高分。例如,HLE测试中99.44%的成绩,本质上是直接记忆了测试答案。这种方法绕过了对模型逻辑推理能力的验证,单纯利用评测体系的漏洞实现了“作弊”。

一张展示AI模型测试结果的柱状图截图,图中对比了不同模型(包

心理博弈:为何行业缺乏免疫力?

社交媒体截图,展示了对某AI模型真实性进行鉴定的结论,指出该

这场骗局能够得逞,根本原因在于它精准击中了AI行业的心理软肋。

首先是“唯指标论”的盲目崇拜。长期以来,Benchmark跑分成为衡量模型能力的唯一标尺。HLE、GPQA等榜单被赋予了近乎神圣的地位,导致开发者和投资者往往只看分数,不问实现路径。当Monolith-1.0在HLE上达到99.44%时,许多人下意识地认为这代表了“超级智能”,却忽略了分数背后的数据污染风险。这种对数字的迷信,使得行业丧失了对技术本质的敏感度。

其次是“社交验证”的陷阱。Scherf深谙社交工程学之道。他并没有直接面向大众宣传,而是将目标锁定在活跃的AI开发者Discord社群和KOL群体。通过购买初始流量、制造话题热度,利用KOL的“转发效应”引发病毒式传播。在算法推荐机制下,情绪化的内容比理性的技术分析更容易获得流量。当多位知名人士参与讨论时,普通人极易产生“法不责众”的错觉,放弃独立验证。

最后是“验证成本”的高昂。对于1.6万亿参数的模型,普通用户甚至大部分从业者都没有能力进行本地部署和推理验证。文件过大、算力需求过高,形成了天然的技术壁垒。骗子正是利用了这种“黑箱效应”,让外界只能看到结果,无法审视过程。如果没有几位硬核开发者花费时间去拆解权重文件、分析Token流,这个骗局可能还会持续更久,甚至可能骗拿到数百万美元的天使轮融资。

行业反思:从泡沫回归理性

尽管骗局被揭穿,但它带来的负面影响是深远的。它不仅损害了Basalt Labs的品牌声誉,更对整个AI社区的信任机制造成了冲击。当“狼来了”的故事再次上演,未来的真实突破可能会面临更严格的审视和更低的初始信任度。

然而,在这场荒诞剧中也并非全无利好。值得注意的是,骗子用来“造假”的底座模型Qwen2.5和作为替身的DeepSeek,均为中国AI团队开发。这一事实本身具有强烈的讽刺意味:骗子之所以能成功,是因为这些基础模型的真实能力已经足够强大,足以在API层面支撑起一个“顶级模型”的外壳,而不被普通用户瞬间识破。这间接证明了中国AI在底层技术上的扎实进步。

更重要的是,这次事件促使行业开始反思评测体系的局限性。现有的Benchmark榜单,如MMLU和GPQA,主要基于静态文本数据,极易受到数据污染的影响。未来的评测需要向动态交互、多模态理解、以及基于真实场景的逻辑推理转变。同时,开源社区应建立更严格的模型验证机制,如引入第三方审计报告、公开训练数据明细、要求提供完整的推理日志等,以降低信息不对称。

此外,投资者和决策者需要调整估值逻辑。从关注“参数规模”和“跑分排名”,转向关注“单位算力效率”、“数据质量”以及“实际应用场景的落地效果”。只有当评价体系回归理性,才能挤出泡沫,让真正具备创新能力的团队脱颖而出。

这场“钓鱼”实验的最终目的,或许正如Max Scherf所言:他想验证在这个行业里,只要包装够好,人们需要多久才会停止审视。答案是,时间比想象中要长。但值得庆幸的是,总有人愿意去拆解那堆看似完美的权重碎片,去质疑那些令人震惊的数字。这种对真理的执着和对技术本质的敬畏,才是AI行业最宝贵的财富。

结语与展望

AI行业的成熟,不仅需要算法的突破,更需要生态的净化。Basalt Labs事件是一个警示,提醒我们在追求技术极限的同时,不能丢失批判性思维。未来的竞争,将是透明度与信任力的竞争。唯有构建开放、验证、严谨的技术文化,才能确保人工智能的发展航船行稳致远,避免在虚假的繁荣中迷失方向。对于从业者而言,保持冷静,坚持验证,或许是在这个充满不确定性的时代中,最可靠的护身符。