Anotações sobre construir um puzzle cujos níveis são provados em vez de chutados. Todo número daqui sai de uma ferramenta do repositório que qualquer pessoa pode rodar de novo.
Quatro publicações, lançadas juntas como uma série.
A medição dizia que nenhuma jogada do jogo conseguia perder um nível: a largura de decisão era 100% em todo lugar. Cobrar por cada jogada derrubou isso para 62% sem tornar um único nível impossível.
O mesmo nível com o mesmo orçamento: beam 45 resolve, beam 90 falha, beam 200 resolve de novo. Qualquer pergunta feita com uma única largura produz falso negativo.
Seis jogadores jogam cada nível e discordam de propósito. Um bot burro vencendo significa que não há puzzle; um bot bom perdendo não significa, sozinho, que há profundidade.
Quatro de dez níveis difíceis não tinham como ser vencidos. A correção foi um pipeline gerar-resolver-filtrar que joga cada nível offline e recusa publicar os que uma busca não consegue vencer.