AIエージェント運用における「挙動悪化」という壁
多くの企業が業務効率化に向けてAIエージェントの導入を進める中、共通して直面するのが「導入初期は高精度だったエージェントの挙動が、運用を続けるうちに悪化していく」という課題です。ユーザーの使い方の変化や、基盤となる大規模言語モデル(LLM)のアップデートなどにより、最初に設計したシステムプロンプトが徐々に適合しなくなる「プロンプトの陳腐化」が発生するためです。
こうした課題に対し、Amazon Web Services(AWS)は2026年8月25日、同社のAIコーディングエージェント「Kiro」のシステムプロンプトを継続的に評価する取り組み事例を明らかにしました。実業務で使われるAIエージェントの品質をいかにして維持・向上させるか、その具体的な方法論が示されています。
AWSが実践する「4段階の評価手順」と「LLMジャッジ」
AWSは、社内の開発者が実際にKiroと交わした数千件に及ぶ会話データをLLMで分析した結果などを組み合わせ、タスク完遂や検証、ツール利用における改善機会を特定しています。この継続的なプロンプト評価の手順は、以下の4つの段階で構成されています。
- 診断(Diagnosis):実際の利用データから課題を洗い出す
- 設計(Design):課題に対応するプロンプトの修正案を設計する
- テスト(Testing):修正されたプロンプトの挙動を検証する
- 評価(Evaluation):本番環境に近いシミュレーションや実データで効果を測定する
このサイクルの中で中核を担うのが、自動で品質を測定する「LLMジャッジ」の仕組みです。LLMジャッジは、社内の会話セッションを15の挙動品質の観点でスコアリングします。この15の観点には、エージェントが断定する前に検証したかという「主張の正確性」や「破壊的アクションのフラグ付け」が含まれています。

CLIおよびIDE環境における改善効果
この継続的な評価プロセスを適用した結果、Kiroの各環境において品質向上のデータが確認されました。
まず、コマンドラインインターフェース環境である「Kiro CLI」において、最初に評価したモデルとプロンプトの構成を適用したところ、以下の改善が見られました。
- 明示的な不満シグナル:5%減少
- 挙動品質の問題:32%減少
- タスク完遂の問題:10.6%減少
さらに、統合開発環境「Kiro IDE」においては、より多角的な項目で改善が報告されています。
- 挙動品質の問題:20%減少
- タスクの未完了配信:21%減少
- 失敗し続けているアプローチ:36%減少
- スタイルの不一致:54%減少
これらの数値は、感覚的な調整に頼りがちだったプロンプトエンジニアリングにおいて、定量的な評価サイクルを回すことがいかに有効であるかを示しています。
自社AIエージェントを運用する企業への示唆
AWSが示したこの事例は、AIエージェントを運用する上で、プロンプトも継続的にテスト・評価し続ける重要性を物語っています。
特に、実際のユーザーの会話ログなどのデータをLLMに多角的な観点(15の挙動品質)で評価させるアプローチは、運用の自動化と省力化を両立させる現実的な解と言えます。LLMジャッジの15の挙動品質の観点には、主張の正確性(エージェントが断定する前に検証したか)や破壊的アクションのフラグ付けが含まれている点も、安全性の面で重要なポイントです。
今後の展望と未確定要素
今回の発表は、AWS社内におけるKiroの運用実績に基づくものであり、この評価フレームワークやLLMジャッジの具体的な詳細、あるいはツール自体が今後どのように展開されるかについては、今後の追加情報が待たれます。
まとめ
AWSによるAIコーディングエージェント「Kiro」の継続的プロンプト評価は、AIエージェントの挙動悪化を防ぎ、常にパフォーマンスを維持するための先進的なモデルケースです。診断・設計・テスト・評価の4段階サイクルと、LLMジャッジによる多角的なスコアリングは、今後のAIエージェント開発・運用における参考となる取り組みです。


コメント