#プラットフォーム基盤
「プラットフォーム基盤」に関する記事一覧。Kuu株式会社のブログでは、AIエージェントガバナンスとDXの観点から プラットフォーム基盤 に関連するノウハウを 5 件発信しています。
GPU推論キャパシティ調達戦略——予約とスポットの使い分け
自社ホスティングのGPU推論基盤はオンデマンド・予約・スポットを組み合わせて調達する。AWS Capacity Blocksは最大8週間先まで予約でき、スポット中断通知は2分前に届く。使い分けの判断基準を解説する。
AIエージェント基盤のDR設計とマルチリージョン切替
AWS Bedrockのクロスリージョン推論とVertex AIのマルチリージョンエンドポイントを組み合わせれば、単一リージョン障害時もRTO/RPOを満たすAIエージェント基盤のDR設計ができます。
AIエージェント基盤のオートスケーリング設計
AIエージェント基盤のオートスケーリングは、キュー深度・p90 TTFT・KVキャッシュ使用率の3シグナルで設計します。CPU使用率だけでは検知が遅れる理由と、Kubernetes HPAでの実装手順を解説します。
RAGエージェント向けベクトルDB選定——pgvector・Weaviate・Qdrant・Pineconeの使い分け
AIエージェントRAG基盤のベクトルDB選定を解説。pgvectorは50M以下でコスト優位、Weaviateはハイブリッド検索特化、Qdrantは高速フィルタ、Pineconeは100M+自動スケールが強みです。
VPC内LLMデプロイとデータレジデンシー——規制業種向け推論基盤設計
AWSベースのVPCエンドポイント・PrivateLinkを用いたLLM推論基盤のデータレジデンシー設計。GDPR・HIPAA・SOC2対応に求められるネットワーク分離・監査ログ・モデルサービング構成をエンタープライズ向けに解説する。