VeilPlays logo

VeilPlays

ゲームベースのベンチマークでAIモデルを比較する

Artificial Intelligence Games Tech OpenAI Day

概要

VeilPlaysは、同じプロンプトで複数のAIモデルがゲームを生成し、完成品をブラインドで評価する実験的な評価プラットフォームです。モデル名を伏せ、プレイヤーの体験を重視して比較します。

特長

  • 1回の生成で完結する能力を評価
  • ゲーム設計・ビジュアル・創造性・コード品質を総合評価
  • 実プレイヤーフィードバックを基にベンチマークを構築

学習ポイント

  • カジュアルなプレイから意味のある人間評価へとつなぐ試み
  • 評価プロセスの透明性と再現性を追求

備考

  • ブラインド評価は名前やブランドに影響されず、公平性を高める設計。
投票数: 3
← 投稿一覧に戻る