人工智能走向实用化之后,产业演进出两条路线。一条是闭源体系,以美国几家头部公司为代表,模型能力最强,技术细节却秘不示人。另一条是开源体系,Meta的Llama开了先河,国内主流模型几乎全数跟进。开源阵营声势日盛,国内舆论对此津津乐道,谈到闭源路线时不免带几分冷嘲热讽,仿佛封闭注定失败,开放必然胜出。
这种情绪可以理解,只是其中有个概念被悄悄置换了。AI所说的开源,与软件业几十年形成的开源传统,并不是一回事。
传统意义的开源,以Linux、MySQL、Nginx为典型。这类软件的全部源代码公开可查,任何人都可以阅读、修改、分支,也可以直接用于生产环境。更重要的是,开源保证了软件的生命不系于一家企业。即便有一天源头公司不复存在,社区手里握着完整的代码,各种衍生版本依然会在网上流传、继续演化。开源在这里意味着彻底的可复现与可延续,这是开源软件能赢得世界信任的根本原因。
AI模型的开源不是这个概念。所谓开源模型,公开的通常只是训练完成后的权重文件,外加一份使用说明。训练数据从何而来,数据如何清洗配比,训练代码怎样写成,算力如何调度,中间踩过哪些坑,这些真正决定模型能力的东西,一概不在公开之列。拿到权重的人可以部署、可以微调,却无法从头复现,更谈不上独立演化。
技术概念抽象,不妨用做菜打个比方。同样是麻婆豆腐,传统开源软件给出的是一份完整菜谱,从原料产地到刀工火候再到成本核算,全流程和盘托出,照着做就能端出同样一盘菜。AI模型的开源则只是告诉你,豆腐一块,肉末少许,郫县豆瓣酱一勺,剩下的靠自己悟。好一点的模型会多提示几句细节,但那盘出神入化的麻婆豆腐究竟如何炒成,永远不会说破。
如此看来,模型开源提供的不过是入门知识。厂商所求的,是让更多人接受并使用自己的产品,让开发者的工具、数据和应用都生长在自己的技术底座之上,进而围绕核心技术形成生态体系。生态一旦成型,迁移成本会把使用者牢牢锁住。厂商真正想做的,是产业链的链主。开放是手段,掌控是目的,这与Linux社区那种把命运交给所有人的开放,逻辑上南辕北辙。
这样说并非否定开源路线。权重开放毕竟降低了门槛,让中小企业和研究者用得起先进模型,客观上推动了技术扩散,价值不容抹杀。我对开源路线从来都非常认可。只是在为开源欢呼之前,不妨先弄清楚欢呼的对象是什么。此开源非彼开源,把生态策略当作理想主义来礼赞,把入门菜谱当作独门秘方来传颂,恐怕既高估了自己得到的,也低估了别人留下的。

