コンテンツへスキップ
スマートくらし
AI・テック

1兆パラメータを1台で抱えない——Mistral・11台AI PC・6000ドル箱から作る「推論配置表」

1兆パラメータ級モデル、11台のAI PCによる分散推論、6000ドルの開発箱が同時に現れました。最大モデルを買う前に、仕事、データ、待ち時間、復旧をどこへ置くか決める推論配置表を提案します。

【PR】当サイトはアフィリエイト広告(Amazonアソシエイト含む)を掲載しています。

📋目次

AIモデルが大きくなるたびに、「何台のGPUが必要か」「自社で動かせるか」が話題になります。しかし、日本企業が最初に決めるべきなのは、最大モデルを所有する方法ではありません。どの仕事をクラウドへ置き、どのデータを社内に残し、どの処理を一台で動かし、どこから複数台へ分けるかです。

2026年10月、仏Mistral AIは総パラメータ数が1兆を超えるMistral Large 4を発表しました。ほぼ同時期に、9750億パラメータの疎なモデルを11台のAI PCへ分散して常駐実行した研究が公開されました。Microsoftは、128GBの統合メモリーを備え、1200億パラメータ超のモデルをローカルで扱えるとする約6000ドルの開発機を予約販売しています。

三つを並べると、「巨大モデルが机へ降りてきた」と見えます。けれども、1兆、9750億、1200億という数字は、そのまま同じ処理能力を意味しません。総パラメータ数、実際に使うパラメータ数、量子化、メモリー、通信、同時利用数、最初の応答までの時間が違います。本稿では、機種やモデルの最大値ではなく、仕事の置き場所を決める「推論配置表」へ翻訳します。

以前の記事では、モデル、データ、権限、測定、退出までを一式で買うAI調達の七つの欄を整理しました。また、無料、有料、限定提供、オープンモデルを業務へ割り当てる能力アクセス表も提案しました。今回は、その能力をどの計算場所へ置けば、費用、データ、速度、復旧のバランスが取れるかへ焦点を絞ります。

クラウドと社内設備の間でAI推論の配置を設計するサーバールーム

結論——モデルを置くのではなく、仕事を配置します

推論基盤は、クラウドかオンプレミスかという二択ではありません。少なくとも次の四つへ分けて考えます。

  1. 公開情報を使う変動の大きい仕事は、APIで始めます。
  2. 機密データを含む短い反復作業は、個人または部署のローカル機へ寄せます。
  3. 大きなモデルを複数人で使う仕事は、共有の専用機または社内サーバーへ置きます。
  4. 一台に収まらない検証は、複数台へ分散しますが、通信と運用を新しい費用として数えます。

重要なのは、同じ仕事を永続的に同じ場所へ固定しないことです。試作はAPI、定型化した機密処理はローカル、利用者が増えたら共有基盤、障害時は小さい代替モデルというように、工程ごとに配置を変えられます。

「自社で動く」は、データが外へ出ないことだけを意味しません。モデルの入手、更新、監視、電力、冷却、故障、担当者交代まで自社へ戻ります。反対に、APIは設備を持たずに始められますが、料金改定、利用枠、提供地域、モデル変更、通信停止の影響を受けます。所有量ではなく、止まった日に別の場所へ仕事を移せる範囲が実用上の主権です。

Mistral Large 4の1兆500億は「毎回1兆計算する」という意味ではありません

Mistral AIが10月6日に公開したMistral Large 4は、総パラメータ数が1兆500億、推論時に使うアクティブパラメータ数が490億のMoEモデルです。画像を扱う16億パラメータのビジョンエンコーダを備え、コンテキスト長は100万トークン、160以上の言語に対応すると説明されています。プレビューAPIの料金は100万トークン当たり入力1.36ドル、出力4.18ドルです。

MoEは、入力ごとに専門家の一部を選ぶ設計です。巨大な総容量を持ちながら、毎回すべての重みを同じように計算するわけではありません。そのため、「1兆パラメータだから、従来の500億パラメータモデルの二十倍の計算が必ず必要」とは言えません。一方で、使わない専門家も含めた重みを保存し、必要な場所から取り出す仕組みは要ります。計算量が疎でも、メモリーとデータ移動の問題は消えません。

Mistralは、このモデルを欧州の自社データセンターで3800基のNVIDIA Grace Blackwell GPUを使って学習し、プレビューも同じ基盤から提供していると説明しています。10月末までに重みを公開し、プライベートクラウドやオンプレミスでも動かせる予定です。ただし、発表時点ではアーキテクチャ、追加ベンチマーク、事後学習方法の詳細を今後共有するとしています。

ここには二つの時間があります。今すぐ試せるAPIの時間と、重み、実行ソフト、必要設備、運用条件を確かめて自社配置を判断する時間です。オープンウェイト公開予定を、翌日から普通の社内PCで同じ性能が出るという意味へ短縮してはいけません。

Mistralは、サイバーセキュリティ、コーディング、金融、法律などの成績を強調しています。数値は主に同社の発表と選んだ評価に基づきます。特定ベンチマークの首位を、自社の日本語文書検索、設計審査、問い合わせ対応の首位へ移すことはできません。日本企業が最初に行うべきことは、1兆という看板を比較することではなく、自社の代表案件を小さなAPI試験へ通し、品質、入力長、出力長、再試行、確認時間を一件単位で測ることです。

11台のAI PCは「余ったPCをつなげば動く」証明ではありません

複数のAI PCへモデルの重みと処理を分配する開発環境

arXivへ投稿されたCascadia研究は、総パラメータ数9750億、アクティブパラメータ数410億のInklingを、11台のAI PCへ分散して常駐実行しました。各機はIntel Core Ultra X7 358H、64GBメモリー、Arc B390統合グラフィックス、ギガビットEthernetを備えています。

研究チームは、モデル本来のルーティング規則を保つ専用MoEエンジンを作り、連続するデコーダー層を各機へ配置しました。OpenVINO向けに圧縮した計算グラフを用い、FP16の専門家計算とFP32への出力復元を組み合わせています。単に一般的な推論ソフトを11台へ導入したのではありません。

測定では、同時実行数を変えた試験で、88ストリーム時に合計60.29トークン毎秒、入力処理などを含む全工程では46.87トークン毎秒へ達しました。一方、15ストリーム時の最初のトークンまでの中央値は6.05秒でした。長い入力では、最初の応答時間が入力長に対して一次項と二次項を持って増え、復号の遅延はおおむね直線的に増えたと報告されています。

この結果は重要ですが、一人の対話速度だけを競う研究ではありません。多数の処理を同時に流したときの合計処理量を高めています。15人が使う社内基盤なら意味がありますが、一人が短い質問へ即答を求める用途では、最初の応答まで6秒という値を別に評価する必要があります。合計トークン毎秒と、一件の待ち時間を同じ「速さ」にまとめてはいけません。

また、研究はそろえた11台、各64GB、ギガビットEthernet、専用エンジンという条件です。部署に残る世代の違うPCを集めれば同じ結果になるとは示していません。故障した一台を外したときの再配置、OS更新、温度、電力、ネットワーク混雑、夜間停止、セキュリティ更新を含む日常運用も、論文の性能値とは別の仕事です。

分散の価値は、巨大モデルを動かした記録だけではありません。一台の高価なGPUへ集中せず、共有メモリーを持つ複数のクライアント機へ重みを分ける設計の可能性を示した点にあります。同時に、ハードウェア費を減らしても、分割、通信、同期、監視、障害対応というソフトウェア費が増えることも示します。

6000ドルの開発箱は、サーバー購入より「待たない試作」に向きます

The Vergeによると、MicrosoftのSurface RTX Spark Dev Boxは5999ドルで予約を開始し、11月に出荷予定です。NVIDIAのArm系RTX Spark基盤、128GBの統合メモリー、100Wの熱設計枠を備え、Microsoftは1200億パラメータ超のモデルをローカルで扱う用途を挙げています。

名称が示す通り、主対象は一般消費者ではなく開発者です。Visual Studio Code、Git、GitHub CLI、GitHub Copilot、WSL、Python、Nodeなどを含む開発向けWindows 11 Pro環境を備え、ローカルモデルの試験、AIエージェントの試作、AIコーディングツールの実行を想定しています。

128GBの統合メモリーは、CPUとGPUが別々の領域へデータを複製する場面を減らし、大きなモデルを一台へ置く余地を広げます。しかし、1200億パラメータ超という上限だけでは、どの精度で重みを保持するか、入力をどこまで長くするか、何人が同時に使うか、毎秒何トークンを得られるかは分かりません。入ることと、仕事の締め切りに間に合うことは別です。

約6000ドルという価格も、クラウド費との単純な割り算だけでは判断できません。設備側には電力、設置、予備機、ストレージ、バックアップ、担当者の更新時間が加わります。API側には入力と出力の従量費、データ転送、再試行、上位プラン、利用枠待ちが加わります。比較する単位は一台の価格ではなく、承認済みの仕事を一件完了する総費用です。

この種の開発箱が合うのは、機密データを使う試作を毎週繰り返し、クラウドへのアップロードや利用枠待ちが開発を止め、同じ担当チームが設備を保守できる場合です。月に数回しか使わず、モデルを頻繁に切り替え、担当者もいないなら、APIの方が安く速く始められる可能性があります。

API、一台、共有機、分散構成を四つの仕事へ割り当てます

推論の置き場所は、組織の理念ではなく仕事の特徴から決めます。

配置向く仕事強み見落としやすい費用
外部API公開情報の要約、需要が変動する試作、複数モデル比較初期設備が小さく、切り替えが速いです従量費、通信停止、利用枠、版変更、データ条件です
個人ローカル機一人の機密下書き、短い反復、オフライン補助データ移動と待ち時間を抑えやすいです端末盗難、更新漏れ、能力差、属人化です
部署共有機定型検索、コード補助、複数人の安定利用環境とモデルをそろえやすいです同時利用、予約、監視、故障時の停止です
複数台分散一台に入らないモデル、研究、同時処理量重視既存の共有メモリー機を束ねる余地があります通信、同期、専用実装、障害点、運用人材です

例えば、社内規程の検索は、文書が機密で利用者が多ければ共有機へ寄せる理由があります。季節ごとの企画案づくりは、短期間だけ需要が増え、複数モデルを比較したいのでAPIが向きます。設計図面を扱う補助は、データを外へ出しにくく、担当者の机で反復するならローカル機が候補です。1兆級モデルの研究は、まずAPIで価値を確かめ、必要な能力が小型モデルで代替できないと分かってから専用機や分散構成を検討します。

順序を逆にすると、設備を使うために仕事を探す状態になります。新しい開発箱を買ったから全部をローカル化する、オープンウェイトだから最大モデルを自社で動かす、空いているPCがあるから分散する、という判断は避けます。

「ローカルだから安全」を四つに分解します

ローカル実行には、データを外部APIへ送らずに済む利点があります。しかし、安全性は場所だけでは決まりません。

第一は入力です。ローカルでも、利用者が不要な個人情報や機密をプロンプトへ貼り、ログを無期限に残せば、端末内の漏えい面は広がります。第二は重みと実行ソフトです。入手元、ライセンス、ハッシュ、更新履歴、依存パッケージを管理します。第三は出力です。モデルが社内にあっても、生成コード、設定変更、顧客文面を無審査で公開すれば影響は外へ出ます。第四は運用です。管理者権限、バックアップ、廃棄、故障交換、ログ閲覧者を決めます。

オープンウェイトも、自由、安全、無料を一括で意味しません。重みへアクセスできれば、特定提供者のAPI停止から離れやすく、評価と改変の余地が増えます。一方、悪用防止、アクセス制限、監査、更新は利用組織の責任になります。Mistralが重み公開前に審査済み組織とレッドチーミングを行うとしている点は、公開と運用を同じ日にしない例でもあります。

ローカルLLMと複数クラウドを「選び直せる範囲」で考えた記事で扱った通り、主権は所有物の数ではなく、別のモデル、別の設備、手作業へ戻れるかで測れます。ローカル機を一台買っても、その専用形式から出られなければ、別の固定が生まれます。

日本企業向けの「推論配置表」

AIの処理時間、費用、データ境界を確認する運用チーム

対象業務を一つ選び、次の九欄を一枚へまとめます。モデル名や機種名は最後に書きます。

欄記録する内容判断の問い
完了対象人の確認やシステム反映を含む一件何が終われば価値が出ますか
入力境界公開、社内限定、個人情報、設計情報外部へ送れないものは何ですか
必要能力文章、画像、コード、検索、道具実行最大モデルでなければできませんか
応答時間最初の応答、完了時間、締め切り一人の速さと全体処理量のどちらが重要ですか
同時利用利用者数、ピーク時刻、待ち行列一台を共有したとき誰が待ちますか
総費用API、設備、電力、保守、確認、復旧承認済み一件はいくらですか
変更モデル、重み、設定、データの更新誰がいつ再試験しますか
縮退小型モデル、別API、手作業一台または回線停止後も続けられますか
移設APIからローカル、単体から共有への移動入力、評価、ログを持ち出せますか

応答時間は、平均値を一つ書かないことが大切です。Cascadia研究のように、合計処理量が高くても最初の応答に数秒かかる場合があります。会話型支援では最初の応答が重要ですが、夜間に百件を処理する業務では総完了時間の方が重要です。

費用も、トークン単価と機器価格を直接比べません。出力を人が直す時間、データを準備する時間、待ち行列、障害対応、モデル更新後の再試験を含めます。高性能モデルで確認時間が減るなら、API単価が高くても一件費は下がる場合があります。安いローカル実行でも、担当者が毎週半日を更新へ使えば一件費は上がります。

30日で配置を決める方法

最初の一週間は、設備を買わず、代表案件を二十件選びます。短い入力、長い入力、画像を含む例、機密を除いた代替例、失敗しやすい例をそろえます。完了条件と人の確認項目を先に決めます。

二週目は、外部APIで基準線を作ります。品質、最初の応答、完了時間、入力と出力の量、再試行、人の修正時間を測ります。モデルのベンチマーク順位ではなく、二十件のうち何件が同じ基準を通ったかを見ます。

三週目は、利用可能な一台のローカル機または共有機で、小さいモデルを試します。最大モデルを無理に入れず、品質が足りる最小構成を探します。ネットワークを切った状態、モデル更新を止めた状態、担当者を替えた状態でも一件を完了できるか確認します。

四週目は、API、一台、共有機の結果を推論配置表へ並べます。一台に入らず、しかもその能力が毎週必要な場合にだけ、専用開発箱や複数台分散の試算へ進みます。分散を選ぶ場合は、一台停止、通信遅延、版の不一致を意図的に起こし、縮退できるかを試します。

30日後の判定は、APIを継続、ローカルへ移設、共有基盤へ統合、範囲を縮めて再試行の四つで十分です。「最新だから導入」「機密だから全部ローカル」という一括判断を避け、仕事ごとに別の出口を選びます。

見るべき七つの指標

導入後は、モデルの総パラメータ数ではなく、次の七つを追います。

  1. 合格一件当たりの総費用です。計算、通信、人の確認、保守を含めます。
  2. 最初の応答時間です。対話を始められるまでの待ち時間を測ります。
  3. 完了時間です。入力から承認済み成果までを測ります。
  4. ピーク時完了率です。同時利用が増えても期限内に終わった割合です。
  5. 配置境界順守率です。許可した場所とデータ条件を守った割合です。
  6. 縮退成功率です。回線、モデル、一台の停止後も代替で終えた割合です。
  7. 移設時間です。API、ローカル、共有機の間で一件を再開する時間です。

七つを一つの点数へまとめません。最初の応答が速くても、ピーク時に完了しなければ共有業務には向きません。費用が安くても、移設に数カ月かかるなら変更へ弱い構成です。境界を守っても、品質不足で人の修正が増えるなら、ローカル化した意味が薄れます。

主な出典

結論——次のAI会議では「何を買うか」より「どこへ戻せるか」を聞きます

Mistral Large 4は、総容量1兆級とアクティブ490億を両立するMoEモデルを、APIと将来のオープンウェイトという二つの経路で提供しようとしています。Cascadia研究は、9750億の重みを11台のAI PCへ分け、大人数の合計処理量を引き上げられる可能性を示しました。Surface RTX Spark Dev Boxは、128GB統合メモリーを一台の開発環境へ置き、ローカル試作の待ち時間を減らす選択肢です。

どれも有望ですが、三つの数字を性能順位へ並べるだけでは、日本企業の配置は決まりません。必要なのは、完了させる仕事、動かせないデータ、許容する待ち時間、同時利用者、保守担当、停止後の代替を先に書くことです。その上で、API、一台、共有機、分散構成を選びます。

次のAI基盤会議では、「最大で何パラメータ動きますか」だけでなく、「この仕事はどこで完了しますか」「一台が止まったらどこへ戻しますか」「来月モデルを替えるのに何日かかりますか」と聞いてみてはいかがでしょうか。巨大モデルの時代に強い組織は、最大の箱を持つ組織ではなく、仕事を最適な場所へ移し直せる組織です。

✍️ この記事を書いた人

ス
スマートくらし 編集部

スマートホーム愛好家として 50 台以上の IoT 製品を自宅でテストしてきた実務経験を持つ。HEMS、音声アシスタント、スマートロック、カメラセンサーなど、住まいに関わるあらゆる IoT 機器の導入・運用・比較評価を専門とする。

スマートホームIoTHEMS音声アシスタントAI 家電