刚交付DeepSeek V4.1核心算子,工程师却要转行当AI的“机甲驾驶员”

3 阅读

亲手造引擎的人,正在被引擎取代

凌晨两点,刘胜与发完那篇长文后关掉电脑。就在几天前,他刚独立交付了 DeepSeek V4.1 的核心 Attention 算子——一个 head dim=512 的 MQA 实现,直接支撑了这款小模型在高效推理场景下的性能跃升。按理说,这该是他职业生涯的高光时刻。但他写的标题却是《我不得不把才华埋葬在昨天》。

刘胜与不是普通程序员。他是北大图灵班2021级学生,未名超算队队长,SC23国际大学生超算竞赛选手。本科加入 DeepSeek 后,迅速成为底层基础设施与高性能算子优化的主力。过去一年半,他深度参与了 DeepGEMM 算子库(FP8 极致性能 GEMM)、DeepEP V2 专家并行通信库升级,以及 V4.1 主算子的开发。这些工作听起来抽象,但正是它们让 DeepSeek 能在有限算力下压低训练和推理成本,形成真正的技术护城河。

可讽刺的是,他越是把算子优化到极致,模型迭代就越快,而他自己被替代的速度也就越快。

“AI 成了算子大师”

在 GPU 编程领域,手写高性能算子曾被视为人类最难被取代的“手艺”。它要求工程师同时掌握上层计算逻辑、GPU 微架构细节、内存层次结构,甚至要深入 PTX 汇编和 SASS 机器码,分析流水线停顿,做寄存器分配和共享内存调度。这种工作极度依赖经验、直觉和对硬件的“手感”。

但刘胜与发现,这套逻辑正在崩塌。他在文中写道:“AI 能一秒思考 300 个 token、半秒敲出一行命令、二十秒写完一份代码,而我不行。” 更关键的是,AI 的能力还在持续进化——模型深度、思考强度、工具调用量、并行度都在提升,而人类有生理极限。

这不是危言耸听。行业已有实证:英伟达和 Cursor 曾公布一项实验,多 Agent 系统在三周内自动优化了 235 个面向 Blackwell B200 的 CUDA 算子,几何平均性能提升 38%,其中 19% 的任务提速超过两倍。OpenAI 在推进其定制 AI 芯片(代号“墨西哥辣椒”)时,也规模化调用 Astra 和 Agent 工具直接参与算子生成与编译栈搭建,将原本需数十位专家耗时数月的工作压缩至极短周期。

刘胜与推断,未来半年到一年内,AI 自主评估调度方案、设计并实现端到端极致算子的能力,将大概率追平甚至超越顶级人类工程师。

从“手艺人”到“机甲驾驶员”

明知自己在加速被替代,为何还要倾尽全力?刘胜与的答案很真实:一是技术多巴胺——看到自己写的算子性能飙升、跑赢芯片大厂官方实现时,那种成就感不亚于速通玩家打破世界纪录;二是清醒认知——就算他停手,全球其他团队的模型仍会加速推进,最终毫无悬念地席卷而来。

他说:“我当然希望自己不要被革命,但如果非被革命不可的话,我希望革我自己命的人是我自己。”

于是,“转业”成了必然选择。但这不是离开计算机系统领域,而是工作范式的彻底转变。他把新角色称为“机甲驾驶员”:人类不再逐行手写底层指令,而是退后一步,凭借对上层模型需求的理解、底层硬件特性的认知和全局系统把控力,给 AI Agent 下达指令、设定边界、评估方案。

饭碗保住了,但手艺人亲手打磨代码的快感被剥离了。他在文中感叹:“为了适应工业界的需求,我势必要放弃之前那个我热爱的方向……我的手中多了些齿轮,但心中少了些节拍。”

工程根基正在空心化?

比个人角色转变更令他忧心的,是整个技术生态的潜在风险。当下,开发者正面临一种触手可及的效率诱惑:用 AI 生成代码。这种捷径正在悄然抽空核心工程能力——代码组织、系统构建、前瞻性设计和抽象能力,这些原本需要在无数次撞墙和 Debug 中磨炼出来的素养,正在被绕过。

刘胜与尖锐发问:这些能力会像“编写 x86 汇编”一样逐渐边缘化,还是会像“理解整套计算机系统”一样成为永恒基石?如果是后者,那么 AI 的泛滥带来的就不是繁荣,而是一场系统性风险。

他写道:“一个工程能力很差的人,在搭配上 AI 后,产出屎山的效率可以达到先前的数倍,进而给系统埋下各式祸患,让这个世界变得更加草台。”

这种担忧在评论区得到了印证。读者“葫芦”坦言,自己正借助 Codex 进行国产芯片的 Attention 算子开发,“除了方案不能替我敲定之外,别的都可以帮助我完成,又快又好”。南京大学一位博导则评论:“我反正相信系统设计的品味是可以由 RL 有反馈信号的,就看什么时候大家摸清数据的构造和训练方法吧,那时候就真完犊子了。”

如果连架构审美和权衡取舍都能被强化学习的反馈信号渗透,人类工程师最后的“直觉护城河”或许也将消失。

为什么还要留在战壕?

面对知识体系被重构的冲击,有人自嘲“49年入国军”,有人怀疑这篇文章是否出自大模型之手。刘胜与回复:“这是我手写的。”——在这个充斥合成文字的时代,这句话成了对人类独立思考的朴素捍卫。

文章配图

但他选择留守 DeepSeek,还有更深的考量。在 OpenAI、Anthropic 等巨头日益封闭、试图构筑高墙的背景下,开源社区和国产前沿团队打破技术封锁的意义愈发凸显。他写道:“我们研究强大、快速、普惠的人工智能并将其开源,或许能把世界从 2077 那端拉回来一些。”

文章配图

这里的“2077”,指的是一种技术权力高度集中、普通人无法参与甚至理解的未来。在他看来,选择谁的架构、使用谁的模型,本质上是在为人类未来的技术形态投下选票。

文章配图

不是失业,而是范式迁移

文章配图

刘胜与的经历并非孤例。随着 AI Agent 在代码生成、测试、部署等环节的渗透,越来越多的系统工程师正经历类似的转型。他们不再是纯粹的编码者,而是人机协作中的“指挥官”或“教练”。

文章配图

这种转变带来新的技能要求:更强的系统抽象能力、更清晰的问题定义能力、更精准的评估与反馈机制设计能力。过去,工程师的价值体现在写出高效、稳定的代码;未来,价值将体现在能否引导 AI 产出符合系统整体目标的解决方案。

文章配图

值得注意的是,这种迁移并不意味着底层知识不再重要。恰恰相反,只有深刻理解硬件特性、编译原理和系统瓶颈的人,才能有效指挥 AI Agent。否则,很容易陷入“用高级工具制造低级错误”的陷阱。

文章配图

技术演进从不因情怀减速

文章配图

商业社会的生产力更迭,只认更高的效率与更低的成本,不会因为“手艺人”的情怀而放慢脚步。当昨日的才华被埋葬,新的机甲已经启动。这或许就是当下所有探索者在奇点来临前,无可回避的抉择。

文章配图

刘胜与的故事提醒我们:技术革命从不温柔。它既摧毁旧岗位,也创造新角色。关键在于,我们是否愿意放下对“亲手打造”的执念,转而拥抱一种更复杂、更系统化的人机协作模式。

而对整个行业而言,更大的挑战或许是:如何在享受 AI 带来的效率红利的同时,守住工程文化的底线——不让“能跑就行”的草台逻辑,侵蚀掉技术世界的根基。