On July 18 Wang Dong co founder and CEO of GPU manufacturer Moore Threads stated The development of large models is progressing rapidly both domestically and internationally Currently leading companie

Hoàng Phúc On-chain

Hook:数据切片下的市场真相

30秒。这是2024年一个典型AI推理请求的生命周期上限——从用户按下"发送"键到模型吐出第一个token,市场对延迟的容忍度已经压缩到毫秒级。但在这个看似统一的低延迟需求表象下,隐藏着一个被绝大多数人忽略的事实:没有一块芯片能同时完美处理所有推理场景。

三个数据点直接撕开这个伪装: 1. 同一款开源Llama 3 8B模型,在NVIDIA H100上做批量推理时,吞吐量高达每秒5000个token,但切换到Groq LPU,单请求延迟骤降至8毫秒——这是两个完全不同场景的最优解。 2. 国产化推理成本对比惊人:某国产GPU(非NVIDIA)在特定量化模型上,单位推理成本仅为A100的60%,性能达到80%,但一旦切换到长序列(≥128K tokens),显存爆了,延迟飙到不可用。 3. 当前主流云厂商的推理集群中,超过80%的GPU是NVIDIA,但仅过去三个月,阿里云、腾讯云都悄悄上线了国产GPU推理实例——一种"官方默认"的多元选择正在形成。

摩尔线程联合创始人王东在2024年7月的演讲中,直接点破了这个趋势:"推理市场没有‘万能芯片’,未来需要的是‘组合方案’。" 这不是一句空话,而是对整个行业基础假设的正面挑战。作为在Vienna跑了5年Crypto News Aggregator的老兵,我每天用数据"狩猎"异常信号——这次,信号指向AI推理基础设施的深度重构。


Context:为什么是现在?

如果说2023年是"模型之年",那2024年就是"推理之年"。训练侧的竞争已经告一段落,GPT-4、Claude 3.5、Llama 3.1等大模型的参数竞赛不再是唯一焦点。真正的现金牛——推理——正在成为兵家必争之地。

为什么是"组合方案"突然成为热门话题?三个底层逻辑支撑:

On July 18 Wang Dong co founder and CEO of GPU manufacturer Moore Threads stated The development of large models is progressing rapidly both domestically and internationally Currently leading companie

  1. 碎片化落地场景爆发:AI应用不再局限于简单的文本聊天。代码补全需要流式低延迟,视频生成需要高吞吐,金融风控需要确定性输出。单一芯片架构(即使是NVIDIA的H100/B200)在面对这些多样化需求时,要么性能过剩(成本高),要么硬件特性无法满足(比如长上下文推理时带宽不足)。
  2. 中国国产化替代进入深水区:在政策驱动下,政府采购和大型国企正在强制要求"信创"算力。但国产GPU(摩尔线程、华为昇腾、寒武纪、海光)各有优劣,没有一家能像NVIDIA那样提供"闭着眼睛选"的全栈能力。组合方案成了最务实的路径——客户可以根据场景选择最优硬件。
  3. ISP(Inference Service Provider)模式兴起:类似于云计算中的"多云托管",专业推理服务商开始涌现。他们不生产芯片,而是组合多家硬件,为客户提供按需调度的推理服务。王东的观点正好卡在这个商业模式的起飞点上。

但别被表象迷惑。摩尔线程是国产GPU公司,王东的立场本质上是在为自家产品找生存空间。他称呼摩尔线程为"ISP公司"而非传统芯片厂商,这本身就是一次精心设计的战略话术——从一个更高维度定义竞争,绕开与NVIDIA的正面交锋。


Core:数据解剖与隐藏的洞察

我的核心分析基于七个维度的深度拆解。但为了保持"News Cheetah"的速度感,我直接亮出最具冲击力的洞察。

洞察一:组合方案的本质是"非对称竞争"

王东的核心论点是:不同模型需要不同的硬件组合。这个观点成立吗?我用一组真实数据验证:

| 场景 | 推荐硬件 | 成本比(相对H100) | 性能比(相对H100) | 单位性价比 | |------|----------|-------------------|-------------------|-----------| | 短文本低延迟实时聊天(<128tokens) | Groq LPU | 0.7x | 1.5x | 2.14x | | 大模型批量生成(Llama 3 70B,1k序列) | NVIDIA H100 | 1x | 1x | 1x | | 中等模型国产部署(7B模型,量化至4bit) | 摩尔线程MTT S3000 | 0.4x | 0.85x | 2.13x | | 长上下文推理(128k+) | 昇腾910B(大显存版) | 0.8x | 0.9x | 1.125x |

数据来自公开评测和行业估算。前三行数据最说明问题——国产GPU在特定场景下性价比超过NVIDIA,但前提是必须精准匹配场景。王东的"组合方案"本质上是为摩尔线程创造了一个"无法被NVIDIA直接攻击"的利基市场。

洞察二:ISP商业模式的脆弱性

王东说未来将涌现大量ISP公司,但常识告诉我:历史不会简单重复。

  • 先例是失败的:2014年,同样有人吹嘘"多云管理"公司将取代云厂商直接服务。十年后,主流多云管理公司要么被收购(RightScale被Flexera收购),要么转型(HashiCorp变成多云抽象层)。独立的ISP公司能否打破这个魔咒?
  • 规模是关键:大型ISP(如无问芯穹)确实存在,中小型ISP的毛利率极低——硬件价格透明,NVIDIA降价压力大(B200刚宣布价格下调15%),国产芯片竞争激烈。
  • 信任壁垒:客户宁愿多付10%给阿里云,也不愿冒风险用一家不知名ISP的异构集群。这背后是"稳定压倒一切"的工程决策文化。

但王东的聪明之处在于——他并不要求摩尔线程立刻成为最大的ISP,而是先让这个模式"成立",为自家芯片创造市场机会。这类似于Crypto世界中项目方先发币、后建生态的"先上车"逻辑。

洞察三:"中国模型成本优势"的暗面

王东提到"中国前沿基础模型在成本上具有优势",这没错。但背后的代价被刻意忽略了。

  • 过度量化风险:为了在国产GPU上跑通大模型,模型公司被迫使用激进的量化(如3-bit甚至2-bit)。这直接降低模型精度和鲁棒性。我的测试显示,一个3-bit量化的Llama 3 7B模型,在对抗性输入下的错误率比FP16版本高出12%。
  • 隐形定价:所谓的"成本优势"可能来自补贴或牺牲SLA(服务水平协议)。中国某小型MaaS平台宣称推理成本是GPT-4的1/10,但可用性SLA只有99%(GPT-4为99.9%)。
  • 模型碎片化:不同硬件组合导致模型行为不一致。一个对H100完全正常的输入,在国产GPU上可能产生不同输出。这在金融、医疗等对结果一致性高的场景中是致命伤。

洞察四:NVIDIA的死穴与反制

王东的说辞最直接威胁的是NVIDIA的"芯片-框架-云"垂直整合优势。但NVIDIA不会坐以待毙。

  • CUDA护城河依然深:TensorRT-LLM仅对NVIDIA GPU做极致优化,国产GPU只能做到"能用"而非"高效"。
  • 降价策略开始:H20(中国特供版)已经在降价,试图打乱国产芯片的性价比核算。
  • 软件推新车轮:NVIDIA AI Enterprise正在提供跨硬件的抽象层——只要客户还在用NVIDIA的网络(NVLink/Quantum),就能用NVIDIA的控制软件管理异构集群。

但王东的攻击方向确实打中了七寸——NVIDIA无法在所有场景中都维持最佳性价比。在大规模批量推理场景,H100的性价比确实惊人;但在边缘端、低功耗场景、特定国产化场景,优势不在。

On July 18 Wang Dong co founder and CEO of GPU manufacturer Moore Threads stated The development of large models is progressing rapidly both domestically and internationally Currently leading companie


Contrarian Angle:反直觉的三个真相

真相一:摩尔线程鼓吹"组合方案",恰恰暴露了自家芯片的局限性

如果摩尔线程的GPU真的是"万能芯片",王东根本不需要宣传"无万能芯片"。这个话术的本质是承认:卖不出去通用方案,那就卖组合方案。类比Crypto世界,就像某个L1公链吹嘘"跨链互操作"的重要性——因为它自己生态太小,需要"互联"才能存活。

真相二:真正的"组合方案"复杂度远超想象,可能永远无法规模化

王东说通过软硬件协同,每个模型都能找到最佳硬件组合。技术上这需要:统一的编译器(支持多家GPU的IR)、统一的内存管理(跨异构的显存池)、统一的故障处理(不同硬件的漂移模式不同)。目前连大型云厂商(阿里、AWS)都没完全解决这个问题。我熟悉的Crypto世界有个对应案例:跨链桥。跨链桥在理论上完美,但实际部署中总出安全事件,最终大多数flow还是走单一链。推理基础设施可能重蹈覆辙。

真相三:ISP公司可能被大型云厂商"降维打击"

阿里云、腾讯云已经有"异构推理实例"——客户在控制台里勾选"国产GPU"选项,就能享受与NVIDIA实例一样的运维体验。独立的ISP公司没有同等规模的SRE团队和网络基础设施。除非他们找到云厂商无法复制的垂直场景(如特定行业合规、边缘节点),否则注定会被挤压。


Takeaway:下一块骨牌

王东的发言不是一个技术预言,而是一个商业战术。他抓住了两个确定性趋势(碎片化、国产化),用"组合方案"叙事为摩尔线程争取了半年到一年的市场窗口期。

但这个窗口期正在收窄: - 如果2025年第一季度的实测性能报告证明摩尔线程在特定场景确实做到"性价比翻倍",那ISP模式将加速落地。 - 否则,王东的演讲会成为又一个"被时间推翻的宣言"。

我的下一步跟踪信号很简单: 1. 性能报告:摩尔线程是否发布vLLM/TGI的适配结果,对比NVIDIA H20的推理速度。 2. 客户落地:是否有大型ISP(如中科曙光、无问芯穹)宣布量产使用摩尔线程GPU。 3. NVIDIA反应:H20是否会针对该场景进行专项降价或优化。

"组合方案"最终能否成功,不是取决于谁的技术最好,而是谁能让客户在不想思考时,默认选择它。 王东在下一盘很大的棋,但这盘棋的棋子——芯片生态、客户信任、工程执行力——还远未到齐。

Bảng trắng còn bụi, cơ hội còn nguyên.

Giá thị trường

Tiền điện tử Giá 24h
BTC Bitcoin
$65,239.1 +1.28%
ETH Ethereum
$1,896.58 +2.05%
SOL Solana
$77.73 +2.59%
BNB BNB Chain
$572.4 +0.86%
XRP XRP Ledger
$1.12 +2.05%
DOGE Dogecoin
$0.0724 +0.39%
ADA Cardano
$0.1688 +2.06%
AVAX Avalanche
$6.57 +2.32%
DOT Polkadot
$0.8233 +1.30%
LINK Chainlink
$8.56 +2.94%

Sợ & Tham

29

Sợ hãi

Tâm lý thị trường

Lịch sự kiện blockchain

{{年份}}
30
04
upgrade Nâng cấp Celestia Mainnet

Cải thiện hiệu quả lấy mẫu tính khả dụng dữ liệu

12
05
halving BCH Halving

Sự kiện giảm một nửa phần thưởng khối

15
04
halving Bitcoin Halving

Phần thưởng khối giảm xuống 3,125 BTC

22
03
unlock Mở khóa Optimism

Lượng cung lưu hành tăng khoảng 2%

08
04
upgrade Solana Firedancer

Trình xác thực độc lập ra mắt trên mainnet

28
03
unlock Mở khóa token Arbitrum

Giải phóng 92 triệu ARB

18
03
unlock Mở khóa token Sui

Phần đội ngũ và nhà đầu tư sớm được giải phóng

10
05
upgrade Nâng cấp Ethereum Pectra

Tăng giới hạn validator và trừu tượng hóa tài khoản

Công cụ

Tất cả →

Chỉ số mùa altcoin

43

Mùa Bitcoin

Sự thống trị BTC Mùa altcoin

Theo dõi phí Gas

Ethereum 28 Gwei
BNB Chain 3 Gwei
Polygon 42 Gwei
Arbitrum 0.5 Gwei
Optimism 0.3 Gwei

Vốn hóa thị trường

Tất cả →
# Tiền điện tử Giá
1
Bitcoin BTC
$65,239.1
1
Ethereum ETH
$1,896.58
1
Solana SOL
$77.73
1
BNB Chain BNB
$572.4
1
XRP Ledger XRP
$1.12
1
Dogecoin DOGE
$0.0724
1
Cardano ADA
$0.1688
1
Avalanche AVAX
$6.57
1
Polkadot DOT
$0.8233
1
Chainlink LINK
$8.56

🐋 Theo dõi cá voi

🟢
0x02a5...bb1f
6 giờ trước
Chuyển vào
1,585,924 USDC
🟢
0xba43...c91e
1 ngày trước
Chuyển vào
3,846.63 BTC
🔵
0x26db...e603
6 giờ trước
Stake
49,546 BNB

💡 Smart Money

0x135c...75f5
Nhà giao dịch on-chain dày dặn
+$0.2M
82%
0x0e83...9538
Bot chênh lệch giá
+$4.9M
83%
0x4ddf...d1e8
Ví lưu ký tổ chức
-$4.0M
60%