Projeto independente · Avaliação de IA

Uma IA consegue construir um bom jogo em uma tentativa?

Game Bench entrega aos modelos de programação o mesmo briefing de jogo, um workspace limpo e nenhum feedback. Todos os resultados permanecem jogáveis, para que você possa inspecionar o código e decidir se a pontuação corresponde à experiência.

Benchmark ao vivo · atualizado conforme novas execuções são avaliadas

Game Bench mostrando o gráfico de pontuação do benchmark versus custo de execução.
Pontuação versus custo estimado de execução
18jogos de navegador avaliados
9rotas anônimas de playtest cego
4pilares ponderados de avaliação
1prompt fixo para todos os modelos

O problema

A maioria das demos de modelos esconde as condições que produziram o resultado.

Um vídeo polido diz pouco quando um modelo recebeu um prompt detalhado, outro teve três rodadas de feedback e um terceiro herdou código funcional. Eu queria um teste de artefato com restrições visíveis.

Jogos de navegador obrigam o modelo a combinar interação, estado, renderização, onboarding, balanceamento, estados de falha e polimento. Em um minuto, dá para saber se o resultado funciona.

O protocolo

Mesma tarefa. Mesma regra de parada.

Execuções reproduzíveis · artefatos públicos · comparação consciente de custo

  1. 01

    Fixar o briefing

    Cada modelo recebe as mesmas restrições de mecânicas, plataforma, arte, áudio e qualidade.

  2. 02

    Deixar construir

    O modelo começa num workspace vazio. Não ofereço correções, exemplos nem prompts adicionais.

  3. 03

    Avaliar o artefato

    Testo gameplay, aderência ao prompt, engenharia e arte; depois publico o jogo, a rubrica, o custo e a pontuação.

O que aprendi

Um benchmark precisa ter uma opinião sobre trabalho útil.

Passar em testes não torna um jogo divertido. Polimento visual não salva controles confusos. Uma execução barata pode ser a melhor escolha de produto mesmo quando perde em pontuação bruta.

  • O ranking pode ordenar cada pilar de avaliação, não apenas o índice final.
  • O gráfico de eficiência separa qualidade bruta do custo necessário para produzi-la.
  • As rotas cegas permitem julgar o jogo antes de ver o nome do modelo.

Julgue os resultados

Jogue primeiro. Descubra o modelo depois.

Nove builds anônimas estão disponíveis no fluxo de testes cegos.

Começar um teste cego