Projeto independente · Avaliação de IA
Uma IA consegue construir um bom jogo em uma tentativa?
Game Bench entrega aos modelos de programação o mesmo briefing de jogo, um workspace limpo e nenhum feedback. Todos os resultados permanecem jogáveis, para que você possa inspecionar o código e decidir se a pontuação corresponde à experiência.
Benchmark ao vivo · atualizado conforme novas execuções são avaliadas
O problema
A maioria das demos de modelos esconde as condições que produziram o resultado.
Um vídeo polido diz pouco quando um modelo recebeu um prompt detalhado, outro teve três rodadas de feedback e um terceiro herdou código funcional. Eu queria um teste de artefato com restrições visíveis.
Jogos de navegador obrigam o modelo a combinar interação, estado, renderização, onboarding, balanceamento, estados de falha e polimento. Em um minuto, dá para saber se o resultado funciona.
O protocolo
Mesma tarefa. Mesma regra de parada.
Execuções reproduzíveis · artefatos públicos · comparação consciente de custo
-
01
Fixar o briefing
Cada modelo recebe as mesmas restrições de mecânicas, plataforma, arte, áudio e qualidade.
-
02
Deixar construir
O modelo começa num workspace vazio. Não ofereço correções, exemplos nem prompts adicionais.
-
03
Avaliar o artefato
Testo gameplay, aderência ao prompt, engenharia e arte; depois publico o jogo, a rubrica, o custo e a pontuação.
O que aprendi
Um benchmark precisa ter uma opinião sobre trabalho útil.
Passar em testes não torna um jogo divertido. Polimento visual não salva controles confusos. Uma execução barata pode ser a melhor escolha de produto mesmo quando perde em pontuação bruta.
- O ranking pode ordenar cada pilar de avaliação, não apenas o índice final.
- O gráfico de eficiência separa qualidade bruta do custo necessário para produzi-la.
- As rotas cegas permitem julgar o jogo antes de ver o nome do modelo.
Julgue os resultados
Jogue primeiro. Descubra o modelo depois.
Nove builds anônimas estão disponíveis no fluxo de testes cegos.