#プラットフォーム基盤

「プラットフォーム基盤」に関する記事一覧。Kuu株式会社のブログでは、AIエージェントガバナンスとDXの観点から プラットフォーム基盤 に関連するノウハウを 5 件発信しています。

GPU推論キャパシティ調達戦略——予約とスポットの使い分け

自社ホスティングのGPU推論基盤はオンデマンド・予約・スポットを組み合わせて調達する。AWS Capacity Blocksは最大8週間先まで予約でき、スポット中断通知は2分前に届く。使い分けの判断基準を解説する。

AIエージェント基盤のDR設計とマルチリージョン切替

AWS Bedrockのクロスリージョン推論とVertex AIのマルチリージョンエンドポイントを組み合わせれば、単一リージョン障害時もRTO/RPOを満たすAIエージェント基盤のDR設計ができます。

AIエージェント基盤のオートスケーリング設計

AIエージェント基盤のオートスケーリングは、キュー深度・p90 TTFT・KVキャッシュ使用率の3シグナルで設計します。CPU使用率だけでは検知が遅れる理由と、Kubernetes HPAでの実装手順を解説します。

RAGエージェント向けベクトルDB選定——pgvector・Weaviate・Qdrant・Pineconeの使い分け

AIエージェントRAG基盤のベクトルDB選定を解説。pgvectorは50M以下でコスト優位、Weaviateはハイブリッド検索特化、Qdrantは高速フィルタ、Pineconeは100M+自動スケールが強みです。

VPC内LLMデプロイとデータレジデンシー——規制業種向け推論基盤設計

AWSベースのVPCエンドポイント・PrivateLinkを用いたLLM推論基盤のデータレジデンシー設計。GDPR・HIPAA・SOC2対応に求められるネットワーク分離・監査ログ・モデルサービング構成をエンタープライズ向けに解説する。