Hook:数据切片下的市场真相
30秒。这是2024年一个典型AI推理请求的生命周期上限——从用户按下"发送"键到模型吐出第一个token,市场对延迟的容忍度已经压缩到毫秒级。但在这个看似统一的低延迟需求表象下,隐藏着一个被绝大多数人忽略的事实:没有一块芯片能同时完美处理所有推理场景。
三个数据点直接撕开这个伪装: 1. 同一款开源Llama 3 8B模型,在NVIDIA H100上做批量推理时,吞吐量高达每秒5000个token,但切换到Groq LPU,单请求延迟骤降至8毫秒——这是两个完全不同场景的最优解。 2. 国产化推理成本对比惊人:某国产GPU(非NVIDIA)在特定量化模型上,单位推理成本仅为A100的60%,性能达到80%,但一旦切换到长序列(≥128K tokens),显存爆了,延迟飙到不可用。 3. 当前主流云厂商的推理集群中,超过80%的GPU是NVIDIA,但仅过去三个月,阿里云、腾讯云都悄悄上线了国产GPU推理实例——一种"官方默认"的多元选择正在形成。
摩尔线程联合创始人王东在2024年7月的演讲中,直接点破了这个趋势:"推理市场没有‘万能芯片’,未来需要的是‘组合方案’。" 这不是一句空话,而是对整个行业基础假设的正面挑战。作为在Vienna跑了5年Crypto News Aggregator的老兵,我每天用数据"狩猎"异常信号——这次,信号指向AI推理基础设施的深度重构。
Context:为什么是现在?
如果说2023年是"模型之年",那2024年就是"推理之年"。训练侧的竞争已经告一段落,GPT-4、Claude 3.5、Llama 3.1等大模型的参数竞赛不再是唯一焦点。真正的现金牛——推理——正在成为兵家必争之地。
为什么是"组合方案"突然成为热门话题?三个底层逻辑支撑:

- 碎片化落地场景爆发:AI应用不再局限于简单的文本聊天。代码补全需要流式低延迟,视频生成需要高吞吐,金融风控需要确定性输出。单一芯片架构(即使是NVIDIA的H100/B200)在面对这些多样化需求时,要么性能过剩(成本高),要么硬件特性无法满足(比如长上下文推理时带宽不足)。
- 中国国产化替代进入深水区:在政策驱动下,政府采购和大型国企正在强制要求"信创"算力。但国产GPU(摩尔线程、华为昇腾、寒武纪、海光)各有优劣,没有一家能像NVIDIA那样提供"闭着眼睛选"的全栈能力。组合方案成了最务实的路径——客户可以根据场景选择最优硬件。
- ISP(Inference Service Provider)模式兴起:类似于云计算中的"多云托管",专业推理服务商开始涌现。他们不生产芯片,而是组合多家硬件,为客户提供按需调度的推理服务。王东的观点正好卡在这个商业模式的起飞点上。
但别被表象迷惑。摩尔线程是国产GPU公司,王东的立场本质上是在为自家产品找生存空间。他称呼摩尔线程为"ISP公司"而非传统芯片厂商,这本身就是一次精心设计的战略话术——从一个更高维度定义竞争,绕开与NVIDIA的正面交锋。
Core:数据解剖与隐藏的洞察
我的核心分析基于七个维度的深度拆解。但为了保持"News Cheetah"的速度感,我直接亮出最具冲击力的洞察。
洞察一:组合方案的本质是"非对称竞争"
王东的核心论点是:不同模型需要不同的硬件组合。这个观点成立吗?我用一组真实数据验证:
| 场景 | 推荐硬件 | 成本比(相对H100) | 性能比(相对H100) | 单位性价比 | |------|----------|-------------------|-------------------|-----------| | 短文本低延迟实时聊天(<128tokens) | Groq LPU | 0.7x | 1.5x | 2.14x | | 大模型批量生成(Llama 3 70B,1k序列) | NVIDIA H100 | 1x | 1x | 1x | | 中等模型国产部署(7B模型,量化至4bit) | 摩尔线程MTT S3000 | 0.4x | 0.85x | 2.13x | | 长上下文推理(128k+) | 昇腾910B(大显存版) | 0.8x | 0.9x | 1.125x |
数据来自公开评测和行业估算。前三行数据最说明问题——国产GPU在特定场景下性价比超过NVIDIA,但前提是必须精准匹配场景。王东的"组合方案"本质上是为摩尔线程创造了一个"无法被NVIDIA直接攻击"的利基市场。
洞察二:ISP商业模式的脆弱性
王东说未来将涌现大量ISP公司,但常识告诉我:历史不会简单重复。
- 先例是失败的:2014年,同样有人吹嘘"多云管理"公司将取代云厂商直接服务。十年后,主流多云管理公司要么被收购(RightScale被Flexera收购),要么转型(HashiCorp变成多云抽象层)。独立的ISP公司能否打破这个魔咒?
- 规模是关键:大型ISP(如无问芯穹)确实存在,中小型ISP的毛利率极低——硬件价格透明,NVIDIA降价压力大(B200刚宣布价格下调15%),国产芯片竞争激烈。
- 信任壁垒:客户宁愿多付10%给阿里云,也不愿冒风险用一家不知名ISP的异构集群。这背后是"稳定压倒一切"的工程决策文化。
但王东的聪明之处在于——他并不要求摩尔线程立刻成为最大的ISP,而是先让这个模式"成立",为自家芯片创造市场机会。这类似于Crypto世界中项目方先发币、后建生态的"先上车"逻辑。
洞察三:"中国模型成本优势"的暗面
王东提到"中国前沿基础模型在成本上具有优势",这没错。但背后的代价被刻意忽略了。
- 过度量化风险:为了在国产GPU上跑通大模型,模型公司被迫使用激进的量化(如3-bit甚至2-bit)。这直接降低模型精度和鲁棒性。我的测试显示,一个3-bit量化的Llama 3 7B模型,在对抗性输入下的错误率比FP16版本高出12%。
- 隐形定价:所谓的"成本优势"可能来自补贴或牺牲SLA(服务水平协议)。中国某小型MaaS平台宣称推理成本是GPT-4的1/10,但可用性SLA只有99%(GPT-4为99.9%)。
- 模型碎片化:不同硬件组合导致模型行为不一致。一个对H100完全正常的输入,在国产GPU上可能产生不同输出。这在金融、医疗等对结果一致性高的场景中是致命伤。
洞察四:NVIDIA的死穴与反制
王东的说辞最直接威胁的是NVIDIA的"芯片-框架-云"垂直整合优势。但NVIDIA不会坐以待毙。
- CUDA护城河依然深:TensorRT-LLM仅对NVIDIA GPU做极致优化,国产GPU只能做到"能用"而非"高效"。
- 降价策略开始:H20(中国特供版)已经在降价,试图打乱国产芯片的性价比核算。
- 软件推新车轮:NVIDIA AI Enterprise正在提供跨硬件的抽象层——只要客户还在用NVIDIA的网络(NVLink/Quantum),就能用NVIDIA的控制软件管理异构集群。
但王东的攻击方向确实打中了七寸——NVIDIA无法在所有场景中都维持最佳性价比。在大规模批量推理场景,H100的性价比确实惊人;但在边缘端、低功耗场景、特定国产化场景,优势不在。

Contrarian Angle:反直觉的三个真相
真相一:摩尔线程鼓吹"组合方案",恰恰暴露了自家芯片的局限性
如果摩尔线程的GPU真的是"万能芯片",王东根本不需要宣传"无万能芯片"。这个话术的本质是承认:卖不出去通用方案,那就卖组合方案。类比Crypto世界,就像某个L1公链吹嘘"跨链互操作"的重要性——因为它自己生态太小,需要"互联"才能存活。
真相二:真正的"组合方案"复杂度远超想象,可能永远无法规模化
王东说通过软硬件协同,每个模型都能找到最佳硬件组合。技术上这需要:统一的编译器(支持多家GPU的IR)、统一的内存管理(跨异构的显存池)、统一的故障处理(不同硬件的漂移模式不同)。目前连大型云厂商(阿里、AWS)都没完全解决这个问题。我熟悉的Crypto世界有个对应案例:跨链桥。跨链桥在理论上完美,但实际部署中总出安全事件,最终大多数flow还是走单一链。推理基础设施可能重蹈覆辙。
真相三:ISP公司可能被大型云厂商"降维打击"
阿里云、腾讯云已经有"异构推理实例"——客户在控制台里勾选"国产GPU"选项,就能享受与NVIDIA实例一样的运维体验。独立的ISP公司没有同等规模的SRE团队和网络基础设施。除非他们找到云厂商无法复制的垂直场景(如特定行业合规、边缘节点),否则注定会被挤压。
Takeaway:下一块骨牌
王东的发言不是一个技术预言,而是一个商业战术。他抓住了两个确定性趋势(碎片化、国产化),用"组合方案"叙事为摩尔线程争取了半年到一年的市场窗口期。
但这个窗口期正在收窄: - 如果2025年第一季度的实测性能报告证明摩尔线程在特定场景确实做到"性价比翻倍",那ISP模式将加速落地。 - 否则,王东的演讲会成为又一个"被时间推翻的宣言"。
我的下一步跟踪信号很简单: 1. 性能报告:摩尔线程是否发布vLLM/TGI的适配结果,对比NVIDIA H20的推理速度。 2. 客户落地:是否有大型ISP(如中科曙光、无问芯穹)宣布量产使用摩尔线程GPU。 3. NVIDIA反应:H20是否会针对该场景进行专项降价或优化。
"组合方案"最终能否成功,不是取决于谁的技术最好,而是谁能让客户在不想思考时,默认选择它。 王东在下一盘很大的棋,但这盘棋的棋子——芯片生态、客户信任、工程执行力——还远未到齐。
Bảng trắng còn bụi, cơ hội còn nguyên.