KumaKumaAI 国内GPU基盤版

AI全社導入のコスト、
定額に抑えませんか。

従量課金は、使った量で請求が決まります。全社に配るほど、来月いくらになるかが読めません。
KumaKumaAI 国内GPU基盤版は、さくらインターネットの高火力 VRT(NVIDIA H100)を1社で専有して月額固定で運用します。何回使われても、請求は同じです。

月額固定。使用量で請求は変わりません推論も文字起こしも国内DCで完結H100 を1社で専有
使う人数と利用量が増えたとき、請求はどう動くか
従量課金月額固定(国内GPU基盤版)利用量・人数 →

利用が少ないうちは従量課金のほうが安く済みます。定額が効くのは、全社に配って利用が伸びる側の組織です。

さくらインターネット公式事例
高火力 VRT 上で稼働
オープンモデルで構成
Gemma 4(Apache 2.0)
30B クラスを H100 1枚で運用
fp8 量子化
入力・出力は学習に使われません
国内DCの外にデータを出さない
従量課金の構造

全社に配った瞬間、請求は読めなくなる。

使った分だけ払う仕組みが、全社展開と相性が悪い。 高いと感じている請求書の中身は、たいていこの3つです。

費用は、人数 × 利用量で決まる

数人で試したときの請求額は、全社に配ったあとの目安になりません。人数が増え、使われる回数が増えれば、そのぶん請求も増えます。

効果が出るほど、費用も一緒に増える

使われるのは良いことです。ただ従量課金では、利用が伸びた月ほど請求も伸び、来期にいくら積むかを固定して語れません。

上限が決まらない費用は、稟議に書きようがない

判断を止めているのは、上限が無いことです。全社展開の話が金額のところで止まるのは、たいていここです。

従量課金と月額固定

変わるのは、請求の決まり方。

機能は SaaS 版やセルフホスト版と同じです。違うのは、GPU を1台まるごと専有して、その分だけを月額で払うという課金の形です。

従量課金API 利用型のAI全般月額固定KumaKumaAI 国内GPU基盤版
請求額使った量で決まる毎月同じ
利用が増えるとそのぶん増える変わらない
上限無い契約時に決まる
来期の予算見込みで置く確定額で置ける
費用の主な中身API のトークン数GPU 1台ぶんの利用料と運用

月額はユーザー規模の区分で決まり、区分の中では利用回数によらず同額です。区分を超える規模になったときは、契約の見直しをご相談します。何人でも同額、という意味ではありません。

仕組み

AI の処理は、1台のサーバーの中で終わる。

さくらインターネットの国内データセンターにある高火力 VRT(NVIDIA H100)1台に、推論も文字起こしも検索も同居させています。外部の AI API を呼びません。だから従量課金が発生せず、データも外に出ません。

入力
社内文書
会議の音声
社員の質問
→ 国内DCへ
さくらインターネット 高火力 VRT / 国内データセンター / 1社で専有
NVIDIA H100 80GB × 1
LLM 推論
Gemma 4 31B(fp8)
回答の生成・要約・深層調査
音声の文字起こし
faster-whisper large-v3
会議音声を国内GPUで文字に
文書の埋め込み
multilingual-e5-large
ナレッジ検索の索引づくり
同じサーバーの CPU 側
Web アプリと API認証(Keycloak)データベース(pgvector)ファイルストレージ監視とログ
出力
出典つきの回答
議事録と要約
整理されたノート
国内DCから →

GPU の調達と運用はしなくていい

GPU 基盤はさくらインターネットが提供し、その上のアプリと AI の運用は当社が行います。お客様側にサーバー管理の担当を置く必要はありません。

モデルを特定のベンダーに縛られない

Apache 2.0 ライセンスの Gemma 4 を採用しています。API の値上げや提供終了の影響を受けず、必要なら他のオープンモデルにも載せ替えられます。

機能は他の提供形態と同じ

ノート機能、深層調査、Google Drive や Slack との連携は SaaS 版と共通です。置き場所と課金の形だけが違います。

向いている組織

定額が効くのは、利用が伸びる側。

全社展開を控えている

数人での試験導入は終わり、次は全社。ここで従量課金のまま進めると、稟議が金額のところで止まります。

費用を確定額で予算に置きたい

来期の数字を確定額で書きたい管理部門や、上振れの説明を毎月したくない情シス。

データを国外に出せない

規制のある業種や公共の仕事など、社内文書や音声を海外の API に送ること自体が要件に反する組織。

GPU は使いたいが、運用は持ちたくない

オープンモデルを自社専用で動かしたいが、サーバー管理の担当を置けない。基盤はさくら、運用は当社が持ちます。

向かない場合もあります。数人で軽く使う段階なら、従量課金のほうが安く済みます。その場合はSaaS 版の有償トライアルから始めるほうが早い。全社に広げる段になったら、国内GPU基盤版へ移せます。
導入の流れ

まずは、H100 1枚から。

いきなり本番規模の契約はお願いしません。PoC で実測を取り、その数字から本番の構成と月額を決めます。金額は構成で変わるため、個別にご提示します。

01

ヒアリング

利用人数、読ませたい文書の種類と量、データの取り扱い要件を伺います。ここで SaaS 版のほうが合うと判断したら、そう申し上げます。

02

PoC(H100 1枚)

高火力 VRT を1台立て、お客様の実際の文書を入れて動かします。同時に何人まで快適に使えるかを実測し、本番に必要な台数の根拠を取ります。

03

本番構成と月額のご提示

PoC の実測をもとに、GPU の台数とモデルを決めます。月額はこの構成で確定し、契約時に上限として固定します。

04

本番稼働

環境の構築から運用まで当社が行います。お客様側の作業は、認証の設定と利用者への案内が中心です。

よくある質問

聞かれる順に、答えます。

Q.何人でも定額ですか。

利用回数では変わりません。月額はユーザー規模の区分で決まり、区分の中では何回使っても同額です。区分を超える規模になったときは契約の見直しをご相談します。

Q.従量課金より必ず安くなりますか。

なりません。数人で軽く使う段階なら従量課金のほうが安く済みます。定額が効くのは、全社に配って利用が伸びる側の組織です。ヒアリングの時点で SaaS 版のほうが合うと判断したら、そう申し上げます。

Q.どのモデルが動いていますか。

Apache 2.0 ライセンスの Gemma 4(31B)を fp8 量子化で H100 1枚に載せています。要件によって他のオープンモデルも PoC で検証できます。

Q.社内文書は学習に使われますか。

使われません。推論も文字起こしも検索も、さくらインターネットの国内データセンター内の専有サーバーで完結し、外部の AI API を呼びません。

Q.GPU サーバーの契約や運用は誰が持ちますか。

GPU 基盤はさくらインターネットの高火力 VRT、その上のアプリと AI の運用は当社が行います。お客様側にサーバー管理の担当を置く必要はありません。

Q.契約期間はありますか。

GPU を専有する形のため、最低6か月からとしています。PoC はそれとは別の短期のお試しです。

上限を決めてから、
全社に配る。

利用人数と文書の量を伺えれば、PoC の進め方と本番構成の目安をお出しします。