中国Moonshot AIのAIアシスタント「Kimi」と、2026年7月に発表された 総パラメータ2.8兆のオープンウェイトLLM「Kimi K3」。 スペック・ベンチマーク・API料金・日本語対応・企業利用の注意点まで、ITエンジニア目線で整理しました。
Kimi(キミ)は、中国・北京に拠点を置く Moonshot AI(月之暗面)が開発・運営するAIアシスタントです。 2023年10月にリリースされ、当初から「超長文の読解」を強みとして中国国内で存在感を高めてきました。
現在はチャットボットの枠を超え、検索・ファイル解析・資料作成・コーディングを一連のタスクとして自律実行するAIワークスペースとして設計されています。 この方向性はGensparkやPerplexityといったエージェント型サービスと同じ潮流にあり、 「答えを返すAI」から「成果物を作るAI」への移行を体現するサービスと言えます。
用語整理: 「Kimi」がサービス名、「Kimi K3」がその中核で動くモデル名です。 AnthropicのClaude(モデル)とClaude Code(ツール)の関係と同じで、 Kimiにおける対応物が「Kimi K3」と「Kimi Code」にあたります。
Kimi K3は2026年7月16日にMoonshot AIが発表したフラッグシップモデルです。 総パラメータ2.8兆という規模は、公開前提のモデルとしては前例のない水準で、 「3兆パラメータ級で初のオープンモデル」と位置づけられています。
| 開発元 | Moonshot AI(中国・北京) |
|---|---|
| 発表日 | 2026年7月16日 |
| 総パラメータ | 2.8兆(2.8T) |
| アーキテクチャ | スパースMoE(Mixture of Experts)/896エキスパート中、1トークンあたり16個を活性化(約1.8%) |
| 中核技術 | Kimi Delta Attention(KDA:ハイブリッド線形アテンション)、Attention Residuals(AttnRes)、Stable LatentMoE |
| コンテキスト長 | 1,048,576トークン(約100万トークン)/長文による追加課金なし |
| マルチモーダル | 画像・動画のネイティブ理解に対応 |
| 推論モード | 常時有効。reasoning_effortで推論の強度を調整可能 |
| API機能 | ストリーミング、構造化出力(JSON Schema)、ツール呼び出し、コンテキストキャッシング、動的ツール読み込み |
| APIモデルID | kimi-k3 |
| オープンウェイト | Hugging Face(moonshotai/Kimi-K3)で2026年7月27日公開と告知 |
※出典:Kimi API公式ドキュメント、Moonshot AI公式Hugging Faceページ、および各種技術メディアの報道(2026年7月時点)。
なお、重み公開時のライセンス条件は本記事更新時点で確定情報が取れていません。 報道ベースでは複数の説が流れているため、商用利用の可否は必ず公式モデルカードの記載で確認してください。
MoEは、モデル全体を毎回動かすのではなく、入力トークンごとに一部の「エキスパート」だけを選んで動かす仕組みです。 Kimi K3は896個中16個しか使わないため、パラメータ総数は2.8兆でも1回の推論コストは規模から想像するほど大きくなりません。 Moonshot AIは、KDAとAttnResの導入によりスケーリング効率が前世代K2の約2.5倍になったと説明しています。 LLMの基本的な仕組みはLLM(大規模言語モデル)の用語解説もあわせて参照してください。
評価機関によってスコアの出し方が異なるため、ここでは計測元を明記した上で整理します。 全体像としては「総合知能はトップ3〜4位、コーディングはトップ級」というのが2026年7月時点の実像です。
| ベンチマーク | スコア | 順位 | 計測元 |
|---|---|---|---|
| Artificial Analysis Intelligence Index v4.1 | 57 | 189モデル中4位 | Artificial Analysis |
| GDPval-AA v2(44職種・9産業の実務タスク) | 1,687 | 3位(1位Claude Fable 5 Max:1,815 / 2位GPT-5.6 Sol Max:1,747.8) | GDPval-AA |
| Vals Index | 74.70% | 38モデル中2位 | Vals AI |
| Terminal-Bench 2.1 | 80.90% | 2位 | Vals AI |
| Arena WebDev(フロントエンド生成) | 1,679(暫定) | 1位 | Arena.AI |
| Program Bench / SWE Marathon | — | いずれも首位 | 各ベンチマーク公表値 |
| 出力速度 | 62トークン/秒 | — | Artificial Analysis |
| 初回トークンまでの時間(TTFT) | 1.99秒 | — | Artificial Analysis |
※2026年7月時点の公表値。ベンチマークは計測条件・バージョンにより数値が変動します。数値のみで採用判断せず、自社ユースケースでの検証を推奨します。
注目すべきは紫色でハイライトした行、つまりコーディング・ターミナル操作系です。 総合指標では米国トップ勢に届いていない一方、実際にコードを書いて動かす系のタスクでは首位クラスに食い込んでいます。 逆にDeepSWE・FrontierSWEといった一部のソフトウェアエンジニアリング評価ではClaude Fable 5・GPT-5.6 Solに及ばず、 「あらゆるコーディング用途で最強」とまでは言えない点も押さえておくべきでしょう。
前世代からの変化は「規模の拡大」と「価格の上昇」がセットになっています。 コストを重視する用途では、あえて旧世代を使い続ける判断も合理的です。
| 項目 | Kimi K3 | Kimi K2.6(前世代) |
|---|---|---|
| 総パラメータ | 2.8兆 | 1兆 |
| アクティブパラメータ | 16/896エキスパート | 32B(384エキスパート) |
| コンテキスト長 | 100万トークン | 256Kトークン |
| API入力単価(100万トークン) | $3.00 | $0.95 |
| API出力単価(100万トークン) | $15.00 | $4.00 |
| Intelligence Index | 57 | 44 |
使い分けの目安: 大量のリクエストを捌くバッチ処理・分類・要約なら安価なK2.6系、 長大なリポジトリ全体を読ませる設計レビューや長時間の自律コーディングならK3、という切り分けが現実的です。
| トークン種別 | 単価(100万トークンあたり) | 備考 |
|---|---|---|
| 入力(キャッシュ命中) | $0.30 | コンテキストキャッシング利用時 |
| 入力(キャッシュミス) | $3.00 | 通常の入力 |
| 出力 | $15.00 | — |
コンテキスト長による段階制がない点がポイントです。100万トークンを入れても長文サーチャージは発生しません。 またキャッシュ命中時は入力単価が10分の1になるため、 同じシステムプロンプトや同じリポジトリを繰り返し読ませるエージェント用途ではコスト差が大きく開きます。 なお、API利用開始には最低1ドル以上のチャージが必要とされています。
無料プランでも基本チャット・ファイルアップロード・Web検索は利用できます。 一方でDeep Researchやエージェント機能は日次クレジット制で上限があり、 本格的に使う場合は有料プラン(おおむね月額$19〜$199のレンジで複数階層)が必要です。
※価格・プラン構成は2026年7月時点で確認した情報です。変更される場合があるため、最新の条件は公式サイトでご確認ください。
kimi-k3に差し替えるだけで多くのSDKがそのまま動きます。まずは既存処理の一部をK3に振り替えて、品質とコストを比較するのが安全です。「オープンウェイト=手元のPCで動く」ではありません。Kimi K3の場合、 MXFP4量子化した重みだけで約1.4TBあり、 実行時オーバーヘッドを含めると単一のH100/H200/B200に載る規模ではありません。
| 重みサイズ | MXFP4量子化で約1.4TB(FP16なら約5.6TB相当) |
|---|---|
| 数値形式 | 重みMXFP4/活性化MXFP8。NVIDIA Blackwell・AMD MI400系がネイティブ対応 |
| 最小構成の目安 | 80GBクラスGPU×8基のノードを8台(計64基)程度。Moonshot AIは64アクセラレータ以上のスーパーノード構成を推奨 |
| その他の要件 | 高帯域インターコネクト、MXFP4/MXFP8対応カーネル、エキスパートルーティング対応、大容量ホストRAM、高速チェックポイントストレージ |
つまり個人・中小規模でのセルフホストは非現実的で、実質的な選択肢は ①公式API ②クラウド事業者のホスティング ③大手企業の自社クラスタの3つです。 それでも重みが公開される意義は大きく、「機密データを国外APIに送らずに最先端モデルを使う」道が理論上開かれた点が本質的な価値になります。
| モデル | 提供元 | 重み公開 | 強み | 向いている用途 |
|---|---|---|---|---|
| Kimi K3 | Moonshot AI(中国) | ◎ | コーディング・100万トークン文脈・コスパ | 大規模コードベース解析、長時間の自律コーディング |
| Claude | Anthropic(米) | × | 総合知能・長時間エージェント作業・安全性 | 設計・レビュー・業務組み込み全般 |
| GPTシリーズ | OpenAI(米) | × | 総合力・エコシステムの厚み | 汎用チャット、幅広い業務効率化 |
| Gemini | Google DeepMind(米) | × | マルチモーダル・Workspace統合・コスパ | Google環境での業務、動画・画像処理 |
| DeepSeek | DeepSeek(中国) | ◎ | 低コスト・推論モデル | コスト最優先のバッチ処理 |
| Llama 4 | Meta(米) | ◎ | 商用利用可・エコシステム | オンプレ・自社ファインチューニング |
※2026年7月時点の一般的な傾向をまとめたものです。各モデルは頻繁に更新されます。
Kimi K3を含む主要LLM・コード生成・AIエージェント・画像/動画生成など11カテゴリのAIツールを一覧で整理。「どのツールが何に使えるか」を俯瞰したい方はこちらから。
性能とコストだけで判断すると見落とすのが、データの保管先と準拠法です。 ここは米国製サービスと事情が異なるため、導入検討時には必ず整理してください。
現実的な落としどころ: 公開情報の調査・OSSのコード解析・個人の学習用途であれば十分に実用的です。 一方、機密データを扱う業務では、社内のコンプライアンス部門にデータの所在と法的管轄を確認してからにしましょう。 どうしても機密環境で使いたい場合は、APIではなくオープンウェイトを自社管理下で動かす構成が検討対象になります。
※本セクションは2026年7月時点で公開されている利用規約・プライバシーポリシーに関する報道・解説をもとに整理したものです。法的助言ではありません。実際の判断は原文と自社の法務部門の確認に基づいて行ってください。
Kimi K3のようなオープンウェイトLLMの検証・導入経験は、転職市場で分かりやすい差別化要素になります。 モデル選定・コスト試算・データガバナンスまで語れる人材は、 AIエンジニア・ バックエンドエンジニアの求人で高く評価されます。 RAG(検索拡張生成)の実装経験があればさらに有利です。
まずは生成AIカオスマップでツール全体の地図を押さえ、 自分の担当領域で使えるものから実務に組み込んでいくのが近道です。
Kimiは中国・北京のMoonshot AI(月之暗面)が開発するAIアシスタントです。kimi.comのWeb版・モバイルアプリ・OpenAI互換API・CLIツール「Kimi Code」から利用でき、チャットだけでなく検索・ファイル解析・資料作成・コーディングを一括で実行するエージェント機能に力を入れています。2026年7月時点の最新モデルがKimi K3です。
Kimi K3は2026年7月16日にMoonshot AIが発表したフラッグシップLLMです。総パラメータ2.8兆のMoE(Mixture of Experts)構成で、896のエキスパートのうち1トークンあたり16個だけを活性化します。コンテキストウィンドウは1,048,576トークン(約100万トークン)、画像・動画のネイティブ理解に対応。3兆パラメータ級で初めて重みが公開されるオープンウェイトモデルであり、コーディング系ベンチマークで米国トップモデルに肉薄した点が最大の注目点です。
kimi.comには無料プランがあり、基本チャット・ファイルアップロード・Web検索が利用できます。Deep Researchやエージェント機能はクレジット制で日次上限があり、本格利用は有料プランが必要です。APIは従量課金で、100万トークンあたり入力3ドル(キャッシュ命中時0.30ドル)・出力15ドル。コンテキスト長による段階料金はありません。
日本語の入出力に対応しており、日本語での質問・長文要約・翻訳は問題なく動作します。ただしベンチマークで強みが示されているのは主に英語・中国語・コードであり、日本のビジネス文書特有の言い回しや業界慣行の理解については個別検証が必要です。日本語の最終品質が問われる用途では、生成物のレビュー工程を前提に組み込むのが現実的です。
総合力ではClaude Fable 5やGPT-5.6 Solが上位で、Kimi K3はそれに次ぐ位置づけです。一方でコーディング系ベンチマーク(Program Bench・SWE Marathon・Arena WebDev等)ではKimi K3が首位や首位相当のスコアを記録しています。「総合知能はトップ3、コーディングはトップ級、価格は総合トップ勢より安い」というのが2026年7月時点の実像です。
技術的には可能ですが、個人PCでは現実的ではありません。MXFP4量子化した重みだけで約1.4TB、実行時オーバーヘッドを含めると80GBクラスのGPUを64基以上(8ノード×8基相当)並べたクラスタが目安です。加えてMoE特有の高帯域インターコネクトとエキスパートルーティング対応が必要になります。自前運用よりは、API利用かクラウド事業者のホスティング利用が現実解です。
Kimiは中国法人が提供するサービスのため、準拠法とデータの保管先が米国製サービスと異なります。プライバシーポリシー上、データが利用者の居住国外のサーバーへ転送・保管される可能性がある旨が記載されています。顧客情報・未公開情報・ソースコード等の機密データを入力する場合は、事前に社内のコンプライアンス部門で法的管轄と学習利用の可否を確認してください。機密性の高い用途では、API経由ではなくオープンウェイトを自社環境で動かす選択肢も検討対象になります。
前世代のK2.6は総パラメータ1兆・エキスパート384・コンテキスト256Kでしたが、K3は総パラメータ2.8兆・エキスパート896・コンテキスト100万トークンへ拡張されました。アーキテクチャもKimi Delta Attention(KDA)とAttention Residuals(AttnRes)を新たに採用し、スケーリング効率が約2.5倍向上したとされています。一方でAPI価格は入力0.95ドル→3ドル、出力4ドル→15ドルへ上昇しており、用途によってはK2.6系を使い続けるほうが合理的な場合もあります。