Pesquisa

Modelos, avaliação
e método.

O trabalho técnico por trás do Shakk — o que já foi validado, o que estamos testando e como avaliamos se um modelo está pronto.

Metodologia

Como decidimos se um modelo está pronto.

Avaliação orientada por hipótese

Cada mudança de treino parte de uma hipótese testável, não de "vamos ver se melhora". Regressão em qualquer eixo é motivo de investigação, não só o eixo que se quis melhorar.

Conversa real, não só bateria isolada

Um modelo pode vencer uma bateria de perguntas soltas e ainda assim colapsar numa conversa longa de verdade — por isso conversas fixas de múltiplos turnos fazem parte de toda avaliação.

Preferir admitir a inventar

Um modelo que admite não saber é preferível a um que responde com confiança sem base. Isso é medido a cada avaliação, não só desejado.

Onde estamos

Trabalho em andamento, não benchmark pronto.

A Fluqxo ainda não publicou artigos técnicos ou benchmarks formais — o Shakk está em desenvolvimento ativo, e a infraestrutura de inferência que vai sustentar as respostas em produção ainda está sendo colocada no ar. Preferimos não publicar números até que representem o sistema real que você vai usar.

Quando houver avaliação pronta pra compartilhar, ela aparece aqui — com metodologia, dados e limitações, não só o resultado favorável.