BananaMind 2 Pro:用 1000 亿 token 追近 SmolLM2,训练只靠一张 5070 Ti
小模型也能打?BananaMind 2 Pro 的实测表现
最近有个挺有意思的项目冒了出来:BananaMind 2 Pro,一个参数量约 1.4 亿的小语言模型。它的特别之处不在于规模——这个量级早有不少开源模型——而在于它只用了 1000 亿个训练 token,就几乎追上了 Hugging Face 官方推出的 SmolLM2-135M。
SmolLM2 可是喂了整整 2 万亿 token 才训练出来的。换算一下,BananaMind 2 Pro 用的 token 量只有对方的 1/20。按理说差距应该很明显,但实际跑分出来,很多人有点意外。
先看一组核心数据对比:
| 基准测试 | BananaMind 2 Pro | SmolLM2-135M |
|---|---|---|
| PIQA | 67.52% | 68.44% |
| HellaSwag | 42.78% | 43.22% |
| ArithMark 3 | 38.20% | 39.20% |
| ArithMark 2 | 32.08% | 32.68% |
这些任务主要考察常识推理和基础算术,两者差距基本在 1 个百分点以内。综合所有指标,BananaMind 2 Pro 保留了 SmolLM2 约 96.08% 的性能。考虑到训练数据量差了 20 倍,这个效率确实值得留意。
用户投票反而更喜欢它
不过,光看标准 benchmark 可能不够全面。毕竟模型最终是给人用的,真实体验可能和分数不完全一致。

项目团队提到,在社区维护的 SLM Arena 盲测平台上,用户会看到两个模型对同一问题的回答,然后投票选哪个更好。截至 2026 年 9 月 18 日的数据,BananaMind 2 Pro 以 1163.8 Elo 分 排名第一,而 SmolLM2-135M 是 1082.1 分,落后了 81 分。
这意味着,尽管在传统测试中略逊一筹,但普通用户在实际交互中更认可 BananaMind 2 Pro 的输出。这或许说明它的回答风格更自然、更符合直觉,或者在某些日常任务上做了针对性优化。
如果你感兴趣,可以直接去 SLM Arena 试试看,亲自投几票感受下差异。
训练数据怎么配的?
这么高的效率,背后肯定有讲究。BananaMind 2 Pro 的 1000 亿 token 并不是随便抓的网页数据堆出来的,而是经过精心设计的混合配方:
- FineWeb-Edu:501.66 亿 token(50.17%)— 来自教育类网页的高质量文本
- DCLM:261.25 亿 token(26.13%)— 另一个大规模网页语料库
- Cosmopedia-v2:135.25 亿 token(13.53%)— 合成的教科书式内容
- FineMath-4+:78.75 亿 token(7.88%)— 专门的数学题数据集
- NPSet-2 Python Edu:23.09 亿 token(2.31%)— Python 编程教学数据
简单说,四分之三的数据来自通用网页(FineWeb-Edu + DCLM),剩下四分之一则聚焦在 数学和编程 上。这种组合可能让它在逻辑和算术任务上表现突出,同时保持一定的语言通顺度。
和初代 SmolLM-135M 比呢?
有意思的是,BananaMind 2 Pro 不仅接近 SmolLM2,甚至在某些方面超过了更早的 SmolLM-135M。后者训练用了 6000 亿 token,是 BananaMind 的 6 倍。
具体来看:
- HellaSwag:42.78% vs 42.70%(微弱领先)
- ArithMark 3:38.20% vs 36.00%(领先 2.2 分)
- ArithMark 2:32.08% vs 28.84%(领先 3.24 分)
- Base Bench:1138 vs 1125(综合得分更高)
Base Bench 是一个综合评分指标,BananaMind 2 Pro 在三个模型中拿了最高分。这说明,在同等参数规模下,更少但更高质量的数据,可能比海量低质数据更有效。
弱项也很明显:代码能力不足
当然,BananaMind 2 Pro 并非全能。它的短板主要在 代码生成 上。
- BananaMind 2 Pro:1407 分
- SmolLM2-135M:1485 分
- SmolLM-135M:1585 分
它不仅落后于 SmolLM2,连初代 SmolLM 都比不过。这很可能是因为代码数据只占训练集的 2.3%,投入明显不足。如果未来想提升编程能力,增加 Python 或其他语言的训练比例会是直接办法。
另外,在 ARC Easy(科学常识推理)和 INT Index(综合智能指数)上,它也落后较多:
- ARC Easy:53.38% vs 58.63%
- INT Index:24.96 vs 27.13
这些任务需要更广泛的背景知识,可能正是那缺失的 1.9 万亿 token 所覆盖的内容。
真的只用了一张 5070 Ti?
最让人惊讶的或许是硬件条件。整个 1000 亿 token 的训练过程,是在一块 RTX 5070 Ti 16GB 显卡上完成的。这是张消费级显卡,价格远低于数据中心常用的 A100 或 H100。
项目发起人强调,BananaMind 的初衷就是证明:有意义的语言模型研究,不该被昂贵的算力门槛拦住。1.4 亿参数的模型足够小,可以在普通台式机上完成训练、推理、调试和修改,这对个人开发者或小团队非常友好。
这也解释了为什么他们如此关注“每 token 的性能”——因为资源有限,必须精打细算。
关键启示:token 数不是万能的
这次实验最大的收获,可能不是某个具体分数,而是打破了“越多越好”的迷思。
SmolLM2 的 2 万亿 token 训练确实带来了优势,但 BananaMind 2 Pro 用 1/20 的数据量达到 96% 的性能,说明 数据质量、混合比例、模型架构和训练策略同样重要。
换句话说,盲目堆 token 不如聪明地选数据。尤其是在小模型场景下,精准的领域数据(比如数学、教育)可能比泛泛的网页爬取更有效。
团队也明确表示,下一步会尝试 全新架构,而不是继续在现有框架上微调。这说明他们意识到,要突破当前瓶颈,光靠数据优化可能不够,结构创新才是关键。
总结
BananaMind 2 Pro 不是一个“打败” SmolLM2 的模型,但它提供了一个很有价值的参照:在资源受限的情况下,如何通过数据工程和训练策略,最大化小模型的潜力。
对于 hobbyist 开发者、学生或预算有限的研究者来说,这个项目展示了另一种可能性——你不需要 GPU 集群,也能做出有竞争力的成果。而对整个社区而言,它提醒我们:评估模型时,除了 benchmark 分数,真实用户体验同样重要。
毕竟,AI 最终是要服务人的,不是服务排行榜的。