15万人围观的AI巨骗:伪万亿模型如何撕开行业遮羞布?

7 阅读

在2026年7月的AI舆论场中,一场持续数小时的信息风暴不仅刷新了社交媒体的热度纪录,更以极其荒诞的方式,撕开了当前人工智能行业在狂热扩张期下的多重隐疾。一个名为“Basalt Labs”的神秘实验室,通过发布号称拥有1.6万亿参数的“Monolith-1.0”模型,瞬间登顶全球AI性能榜单。然而,这场被精心包装的“技术奇迹”,在短短几小时后便被硬核开发者拆解为一场彻头彻尾的社会实验与骗局。这一事件不仅让15万围观者陷入“被钓鱼”的尴尬,更迫使整个行业重新审视对模型参数、基准测试(Benchmark)以及技术背书的盲目信任机制。

Basalt Labs发布Monolith-1.0大模型的技

虚假王座的构建:参数崇拜与信息不对称

Basalt Labs官方账号发布的关于Monolith-1

事件的开端极具戏剧性。Basalt Labs在没有任何预热和技术社区互动的情况下,直接在X平台(原Twitter)抛出了一组令人窒息的性能数据:在HLE(高阶逻辑推理)测试中取得99.44%的成绩,GPQA Diamond达到95.9%,MMLU-Pro高达96.2%,且在12,288块昇腾910C NPU上训练了60万亿Token。这些数字不仅打破了现有纪录,更迎合了科技圈长期存在的“FOMO”(错失恐惧)情绪。

包含多个大模型在Humanity\'s Last Exam、G

在当前的AI产业语境中,参数量往往被视为衡量模型能力的核心指标之一。当“万亿参数”与“登顶世界第一”结合时,其冲击力足以掩盖许多本应被质疑的细节。Basalt Labs进一步通过制作精良的官网、看似专业的学术论文以及“180名顶尖研究人员”的团队背书,构建了一个具备“大厂质感”的技术形象。这种形象管理精准击中了行业痛点:在海量新技术涌现的背景下,普通从业者和投资者缺乏时间精力去逐行审核每一篇论文或每一个权重文件。

Basalt AI 聊天界面的截图,展示了产品的主界面、功能

然而,这种基于信息不对称的权威构建,在面对专业开发者时显得脆弱不堪。当用户尝试从Hugging Face下载所谓的“MIT协议开源”模型时,破绽开始显现。数千个权重分片文件在字节大小上完全一致,且缺乏正常的配置文件和分词器。这种粗劣的技术实现与宣称的“1.6万亿参数”形成了荒谬的反差,暗示了背后可能存在巨大的技术谎言。

社交媒体截图,展示了关于伪造CVE编号和恶意软件后门的安全漏

技术拆解:API套壳与数据投毒

YouTube视频截图,展示了AI模型Basalt Mono

随着质疑声浪的升高,开发者们深入代码底层,揭开了骗局的核心运作逻辑。所谓的“Monolith-1.0”网页端Demo,其流畅的对话体验并非源于自研的大模型推理,而是通过隐藏调用DeepSeek模型的API接口实现的。这一发现通过Token切分分析得以证实,其输出格式与DeepSeek的Tokenizer完全匹配。

Artificial Analysis 网站关于模型开放度(

更具讽刺意味的是,通过越狱手段获取的系统提示词显示,该模型被强制要求“始终自称Monolith-1.0”并“否认底层模型存在”。这种机械式的指令掩盖了模型真实能力的不足。当被问及2025年12月之后的近期事件时,模型因缺乏对应训练数据而胡言乱语,彻底暴露了其知识库的滞后性与虚假性。

Monolith-1.0 技术验证报告的长截图,包含系统提示

至于Hugging Face上那3TB的“权重文件”,实则是利用Qwen2.5-7B-Instruct的权重碎片,通过循环复制和随机数据填充暴力拼接而成。这种“俄罗斯方块”式的拼装手法,虽然在视觉上满足了文件大小要求,但在模型训练和推理逻辑上毫无意义。这一技术细节揭示了造假者对模型内部结构的蔑视,也反映了当前部分市场参与者将AI能力简化为“文件大小”和“跑分数字”的认知偏差。

一张关于AI模型真实性鉴定的推文截图,内容指出某1.57T模

骗局复盘:从背答案到病毒式营销

Hugging Face 平台上 DeepSeek-V4-P

事后,骗局操盘手Max Scherf通过视频详细披露了这一“社会实验”的全过程。其核心逻辑并非技术创新,而是对评测机制漏洞的精准利用与营销心理学的高阶应用。

第一步是“背答案”。Scherf指出,想要刷榜第一,无需研究复杂架构,只需针对GPQA、AIME、MMLU-Pro和HLE等公开榜单的测试集答案进行微调。由于部分题目已被大量公开,通过简单的格式调整和针对性训练,模型即可在特定基准测试中取得近乎满分的成绩。这种“应试教育”式的优化,使得模型在封闭测试中表现卓越,却完全丧失了泛化能力。

一张展示AI模型评测对比结果的柱状图截图,包含不同模型(如m

第二步是构建“真实性”。从购买域名、搭建硅谷风格官网,到利用AI生成充满技术黑话的论文,再到编造180人的研发团队和辉煌履历,每一步都旨在营造一种“不可忽视”的大厂气场。Scherf笃定,在最初的震撼面前,很少有人会去验证一个3TB文件的技术合理性。

第三步则是病毒式营销。通过精准投放到AI开发者Discord社群,并借助KOL的转发,消息迅速扩散。在“不转不是潮人”的心理驱动下,整个行业陷入了一场集体性的信息狂欢,直到少数较真者介入,才使泡沫破裂。

行业反思:遮羞布下的信任危机

这场闹剧的最终目的,是验证一个残酷的猜想:在当前的AI生态中,只要包装足够专业、参数足够庞大、跑分足够高,加上关键意见领袖的助推,行业需要多久才会有人愿意真正去审视模型本身?答案令人沮丧:几乎没有人。

Scherf的实验扯下了几块行业的“遮羞布”。首先是走火入魔的跑分文化。当基准测试成为融资和宣发的唯一硬通货,模型的实际可用性被严重边缘化。其次是参数迷信与规模崇拜。万亿参数不再是技术突破的标志,而沦为数字游戏的筹码。最后是缺乏实质审查的现状。如果此次实验成功,这家假实验室很可能已经拿到了数百万美元的天使轮融资。

然而,在这场荒诞剧中,唯一值得欣慰的细节是,骗子用来作为底座的Qwen 7B和用于后端输出的DeepSeek API,都是真实且强大的中国AI模型。这侧面证明了中国AI在推理和生成能力上,已经具备了极高的行业通用性。骗子之所以能成功,正是因为中国AI的基础能力足以支撑高水平的伪装,而不被普通用户瞬间识破。

这一事件也预示着AI行业需要进入一个新的阶段:从规模扩张转向质量验证,从跑分竞争转向应用实效。开源社区、科研机构以及投资者需要建立更严格的模型验证机制,不再盲目相信论文中的数据图表,而是深入代码底层、权重分布以及实际应用场景,去评估技术的真实价值。

世界或许是一个巨大的草台班子,但技术的进步容不得半点虚假。当泡沫破裂,留下的应当是更透明的评测体系、更理性的资本态度,以及对技术本质更深层次的尊重。Basalt Labs的骗局虽已结束,但它所引发的关于AI信任、验证与行业生态的思考,才刚刚开始。