プレイテストエージェント
ゲームを最後までプレイする、AIゲームテスター
ゲームスタジオは、プレイテストに年間17億ドルを費やしました。同じように費用をかけ続ける必要はありません。
AIを使えば、ゲーム全体のプレイテストが数分で終わります。Zivaのプレイテストエージェントは、ゲームを最後までクリアでき、数十のインスタンスを並列で実行できます。PC、モバイル、コンソールのゲームに対応します。
Godotcraftで行った実際のプレイテストです。開始から判定までの流れは次のとおりです。
- 1木を切り倒してクラフトベンチを作るよう、プレイテストエージェントに指示します。
- 2エージェントはゲームを解析し、移動、経路探索、木のブロック、クラフトの仕組みを把握します。
- 3木まで歩き、丸太を切り出して拾い、クラフトベンチを作ります。
- 4開始から終了までを収めた映像をAIが解析して合否を判定し、後から確認できるよう保存します。
仕組み
AIによるプレイテスト
「the score goes up when the player clears a pipe(土管を抜けるとスコアが上がる)」のようなテスト項目を渡すと、AIはその動作を確認できるまでプレイを続けます。
コードの読み取り
ゲームのコードを解析して目標の達成方法を考え、一時的なフックやログ出力を追加する箇所を決めます。
起動と一時停止
LLMは、ゲームの進行に合わせてリアルタイムに判断できません。そこでゲームをサンドボックスで起動して一時停止し、LLMが考える時間を確保します。
プレイしながら、操作ごとに計測
実際の入力をゲームに送ります。結果は、スクリーンショット、LLMからの問い合わせに応答する独自のフック、追加したログで確かめます。
合否の判定
実行結果の全体をAIが確認し、各タスクが正しく完了したかを判定します。あわせて、後から確認できるよう映像を保存します。
プレイテストはすべてお使いのマシン上で実行します。外部と通信するのは、データを保持しないLLMに、推論と画像解析に必要な情報を渡すときだけです。プロジェクトのファイル一式がコンピューターの外に出ることはありません。
汎用AIエージェントとの比較
大半のAIエージェントは、ゲームをプレイできません
Cursor、Claude Code、Copilotはコードを書くのが得意です。ただし、どれもゲームそのものは操作できません。「修正しました」と返ってきても、実際はソースコードを読んで推測しているだけです。修正できていないと分かるのは、実際にゲームを遊んだときです。
| 機能 | Cursor · Claude Code · Copilot | Zivaプレイテストエージェント |
|---|---|---|
| ユニットテストの作成と実行 | ターミナル経由 | run_tests、ヘッドレス |
| 実際のゲームの起動とプレイ | ゲームを操作できない | 一手ずつ操作 |
| 実際のプレイヤー入力の送信 | ゲームのウィンドウを操作できない | キー、クリック、ドラッグ、照準 |
| プレイ中のシーンの計測 | コードを読むだけ | プローブと独自のシグナル |
| テスト対象のゲームを書き換えられない | 書き換えてから成功と判定 | 書き込み用のツールを持たない |