前回は、AIを作るための半導体が、企業だけでなく国どうしの競争にもなっている話をしました。

その先に、一つの疑問が残りました。最も強いGPUを十分に手に入れられなければ、もうAI競争では勝てないのでしょうか。

そこへ現れたのが、中国のAI企業、DeepSeekでした。

注目された数字は、約600万ドル。もう少し正確に言うと、約560万ドルです。日本円なら、ざっくり8〜9億円になります。

普通に聞けば、十分に高い金額です。しかし当時、最先端のAIは学習だけで数千万ドル、場合によっては数億ドル規模の費用がかかると推計されていました。そしてDeepSeek自身の評価では、GPT-4oやClaude 3.5 Sonnetのような当時のトップクラスのAIに匹敵する結果を出したテストもありました。

つまり驚かれたのは、8〜9億円が安いからではありません。このレベルのAIを、この規模の計算で作ったのか、という点でした。

今回覚えておきたい核心は一つです。

AI競争は、GPUの強さを比べるだけでなく、限られた計算をどれだけ無駄なく能力へ変えるかの競争でもある。

約560万ドルは、何の値段なのか

この驚きをそのまま受け取る前に、あの数字が何を測ったのかは確かめておく必要があります。

DeepSeekが技術報告で約560万ドルと計算したのは、話題になったR1というモデルの開発総額ではありません。その土台になったDeepSeek-V3というモデルの、公式な学習に使ったGPU時間を、一定の価格で換算した金額です。

報告によると、学習には2048基のNVIDIA H800が使われました。H800は家庭用パソコンに入っているようなGPUではなく、巨大なAIを学習させるための高性能なGPUです。

そして、この数字には、研究や比較実験など、それ以前にかかった費用は含まれていません。会社の設備投資や人件費、サービスの運用費でもありません。

ここで、最初の理解は少し変わります。

DeepSeekという会社やR1を、全部まとめて約600万ドルで作ったという話ではない。それでも、最先端級の性能を目指したV3の公式な学習を、この計算量で終えたという驚きは残る。

では、どうやってそこまで計算を節約したのでしょうか。DeepSeekが公開した技術報告には、その工夫がかなり具体的に書かれていました。

大きなAIを、全部いっぺんに動かさない

DeepSeek-V3は、とても大きなAIです。しかし、質問へ答えるたびに、その中のすべてを同じように動かすわけではありません。入力された言葉に合わせて、必要な部分を選んで動かします。

会社全体へ毎回同じ仕事をさせるのではなく、内容に合った担当者だけが集まる。そういう仕組みです。

技術の世界ではMixture of Experts、日本語では「専門家の混合」などと呼ばれます。名前を覚える必要はありません。大事なのは、AIを大きくしながら、毎回の計算では必要な部分へ仕事を絞ったことです。

DeepSeekはさらに、計算の細かさを調整し、GPU同士がデータをやり取りする待ち時間も減らしました。

一つひとつのGPUを急に強くしたわけではありません。GPUが何を計算するか。どの順番で計算するか。計算とデータの移動をどう重ねるか。モデルと学習システムを一緒に設計して、持っている計算能力が止まっている時間を減らしたのです。

よくある見方DeepSeekの技術報告から見えること
約600万ドルでR1を作った約560万ドルはV3の公式な学習に使ったGPU時間の換算額
GPUをほとんど使わなかった2048基の高性能GPUを使っている
GPUが安かったから安く済んだ必要な部分だけを動かし、GPUを待たせない設計を積み重ねた

ここまで来ると、約560万ドルという数字の見え方が変わります。ただ安かったのではありません。必要な部分だけを動かす。GPUを待たせない。限られた計算から性能を引き出すために、細かな設計を積み重ねた結果でした。

R1は、考え方の学ばせ方も変えた

そのV3を土台に作られたのが、DeepSeek-R1です。

R1でDeepSeekが伸ばそうとしたのは、答えへすぐ飛びつくのではなく、途中で考え、確かめながら進む力です。

そのためにDeepSeekは、数学の答えやプログラムのテスト結果のように、正解を機械で確かめやすい課題を使いました。AIが出した答えを人間が一つずつ採点するだけでなく、合っているかどうかを機械で確認できる課題を使い、強化学習によって推論能力を伸ばしたと説明しています。

もちろん、これにも計算は必要です。R1の技術報告には、学習に使ったGPU時間の総額は書かれていません。だから「R1はほとんど計算を使わずに賢くなった」とは言えません。

それでも、計算を使う場所が一つではないと分かったことは大きな変化です。大きなモデルを最初から学習させるだけでなく、すでにある土台へ、答えを確かめながら考える方法を学ばせる。限られた計算をどの段階へ使うか。そこにも設計の余地がありました。

輸出規制がDeepSeekを作ったのか

ここで、前回の話とつながります。

アメリカは、中国向けの高度なAI用半導体に輸出管理を設けています。DeepSeek-V3の学習に使われたH800も、V3の学習が公表される前に、許可なく中国へ輸出できない対象になっていました。

制約が、少ない計算を有効に使う動機になった可能性はあります。ただ、DeepSeekの公開資料だけから、輸出管理が技術革新の原因だったとは断定できません。

確認できるのは、GPUへのアクセスに制約がある環境でも、モデルと学習システムの工夫で競争力のあるAIを作ったとDeepSeekが報告したこと。そこまでです。原因と結果を、きれいな物語にしすぎない方がよさそうです。

GPUの価値が下がったわけではない

ここまで来ると、最初の問いへの答えも変わります。

DeepSeekは、GPUがいらないと証明したわけではありません。実際に2048基の高性能GPUを動かしています。

強いGPUを多く持てば、より大きな実験を試せる。失敗しても、次を早く試せる。たくさんの利用者へAIを提供する時にも、計算資源は必要です。ハードウェアの差は、今も大きい。

ただし、同じ計算資源を持っていても、使い方が違えば、出てくる能力は同じではありません。

全部を毎回動かすのか。必要な部分へ仕事を絞るのか。データが届くのを待つのか。計算しながら次のデータを運ぶのか。

強いGPUは、AI競争の上限を押し上げる。しかし、そのGPUをどれだけ働かせられるかは、モデルとソフトウェアの設計で変わる。

DeepSeekが見せたのは、計算資源の競争が終わったことではありません。計算資源を、無駄なく能力へ変える競争もある、ということでした。

まとめ

約600万ドルという数字は、DeepSeekやR1の開発総額ではありません。V3というモデルの公式な学習に使ったGPU時間を、一定の価格で換算した数字です。そしてDeepSeekは、GPUを使わずにAIを作ったわけでもありません。

それでも、必要な部分だけを動かすモデル設計と、GPUの待ち時間を減らす学習システムによって、計算資源の使い方を変えました。

AI競争は、GPUの強さを比べるだけでなく、限られた計算をどれだけ無駄なく能力へ変えるかの競争でもある。

ここから、次の疑問が生まれます。

DeepSeekは、V3やR1のモデルの重みを公開しました。技術報告にも、自分たちが工夫した方法を書いています。せっかく見つけた効率のよい作り方なら、会社の中へ隠しておいた方が有利にも見えます。

それなのに、なぜAI企業は自分たちのモデルを公開するのでしょうか。

次回は「なぜAI企業はモデルを公開するのか:オープンモデルの経済」。無料で配っているように見えるモデルが、企業の競争力へどうつながるのかを整理します。