Saltar para o conteúdo
A ideia do Agent Builder, aplicada a ML

Dosdadosembrutoaummodeloqueconseguedefender.

Um agente corre o ciclo de machine learning dentro do seu ambiente, uma ideia por sessão isolada. Um orquestrador que o agente não controla pontua, verifica e julga cada resultado.

Ver como funciona
Corre dentro do seu ambienteUm ganho conta quando é significativoPergunta antes de gastar
demo-churn · execução 4MAQUETA · DADOS DE EXEMPLO

melhor ROC AUC em validação cruzada

0.8412

+0.0391 face à linha de base

melhor até agora, por iteração

  • adotado
  • não significativo
  • rejeitado
  • linha de base
  • gasto em LLM

    1,84 $ / 5,00 $

  • computação

    2,1 h / 6 h

  • iterações

    12 / 20

  • tempo decorrido

    1 h 52 / 4 h

fluxo de eventos

CH.01·O problema

Um modelo que se avalia a si próprio é um modelo que ninguém consegue verificar.

Um agente de programação constrói um modelo numa tarde. Sozinho, também escolhe a semente, reporta a própria pontuação e pode abrir o conjunto de teste.

O agente sozinho: Reporta a sua própria validação cruzada
Com o orquestrador: O harness pontua cada candidato nos mesmos folds fixos
O agente sozinho: Escolhe a semente aleatória
Com o orquestrador: A semente é derivada da execução e nunca escolhida
O agente sozinho: Pode abrir o conjunto de teste
Com o orquestrador: O holdout só é montado uma vez, no fim
O agente sozinho: Fica com qualquer ganho, por pequeno que seja
Com o orquestrador: Um ganho só é adotado quando um teste emparelhado diz que é real
O agente sozinho: Para quando decide que terminou
Com o orquestrador: Uma regra de paragem termina a execução por paciência ou por orçamento
Quem avalia o trabalho. O mesmo agente, os mesmos dados, duas respostas a essa pergunta.

CH.02·Siga uma execução

Uma execução, de uma fonte de dados a uma pontuação no holdout.

Cada experiência é uma sessão nova de um agente, numa sandbox. Tudo o que acontece entre sessões pertence ao orquestrador.

CH.03·O juiz

Os agentes propõem. O orquestrador julga.

O agente escreve o modelo. O harness avalia-o, com regras que o agente não contorna nem altera.

Todas as ideias, nos mesmos folds

MAQUETA · DADOS DE EXEMPLO

A melhor pontuação só muda quando um ganho é adotado. As ideias dentro do ruído ficam no gráfico, esbatidas, para que nada do que foi tentado fique escondido.

1 · 0.8021 · linha de base2 · 0.8109 · adotado3 · 0.8087 · não significativo4 · 0.8190 · adotado5 · 0.8152 · não significativo6 · 0.8236 · rejeitado7 · 0.8297 · adotado8 · 0.8281 · não significativo9 · 0.8344 · adotado10 · 0.8330 · não significativo11 · 0.8412 · adotado12 · 0.8398 · não significativo
  • adotado
  • não significativo
  • rejeitado
  • linha de base

Sete verificações antes de algo contar

  • schemao resultado é um result/v1 válido
  • contracto entrypoint cumpre o contrato
  • gito commit é o HEAD e a árvore está limpa
  • mlflowo run está na experiência desta execução
  • featuresnenhuma variável proibida foi usada
  • seed_enva semente e o hash do ambiente coincidem
  • isolationcada fold foi treinado isolado

Um ganho tem de passar um teste

Teste t emparelhado com reamostragem e a correção de Nadeau–Bengio, unilateral, α 0,05. A correção compensa folds que partilham linhas de treino.

Para por regra

Paciência sobre os ganhos adotados, mais orçamentos de gasto em LLM, computação e tempo. Antes de parar, pode pedir a si próprio uma direção diferente.

MAQUETA · DADOS DE EXEMPLO

Procura onde está a errar

Os segmentos onde o melhor modelo erra de forma significativa voltam ao briefing seguinte, como a primeira coisa que o agente lê.

CH.04·Controlo

A sua equipa conduz. O sistema pergunta antes de gastar.

Três modos de autonomia e uma consola que pode pausar, orientar, vetar ou parar uma execução a qualquer momento.

Autonomia

  • AutónomoCorre o ciclo dentro dos orçamentos.
  • Com aprovaçãoPergunta antes de cada trabalho remoto e mostra exatamente que dados saem.
  • SupervisionadoPergunta antes de cada hipótese.

Nota de orientação

“Experimenta restrições monótonas na antiguidade antes de juntar mais árvores.”

Ana · operadora · 10:42

  • pausar
  • parar
  • vetar uma ideia
  • editar orçamentos
  • promover com um motivo

Conduza-o a partir do Claude Code

Um servidor MCP de operação com 23 ferramentas, atrás do mesmo login e do mesmo registo de auditoria que o cockpit.

❯ claude mcp add --transport http \

auto-ml-scientist \

https://<your-host>/operator/mcp/

✓ 23 tools

Cada decisão, com hora e autor

Aprovações, vetos, notas e promoções ficam num registo só de acréscimo, com a pessoa e o minuto.

  1. 10:42Ananota de orientação adicionada
  2. 10:47Anatrabalho remoto aprovado · limite 4,00 $
  3. 11:03Ruihipótese H-09 vetada
  4. 11:58Ruiiteração 11 promovida · com motivo

CH.05·Resultados

Oito execuções em dados públicos, com os intervalos à vista.

Quatro conjuntos de dados públicos, duas execuções cada, com o claude-opus-5-5 em outubro de 2026. A referência é um LightGBM com definições padrão, pontuado no mesmo holdout.

  • Auto ML Scientist, com o intervalo de 95%
  • a sua linha de base
  • referência: LightGBM padrão
  • california-housing

    RMSE · menor é melhor

    0.47310.3883 · 0.38300.3552
  • bank-marketing

    PR AUC · maior é melhor

    0.60960.6648 · 0.64720.7033
  • adult

    ROC AUC · maior é melhor

    0.92340.9295 · 0.92980.9359
  • credit-g

    ROC AUC · maior é melhor

    0.69430.7798 · 0.78170.8608
gasto em LLM por execução
2,27 $ a 3,34 $
tempo por execução
31 a 141 min
iterações por execução
5 a 7
Ver os números numa tabela
conjunto de dadosmétricalinha de basereferênciaexecuçãointervalo de 95%gasto em LLM
california-housingRMSE0.46500.46350.38830.3698 – 0.4069$2.57
0.46500.46350.38300.3633 – 0.4032$2.58
bank-marketingPR AUC0.63300.63040.66480.6329 – 0.6968$3.34
0.63300.63040.64720.6161 – 0.6783$2.51
adultROC AUC0.92630.92700.92950.9243 – 0.9347$2.27
0.92630.92700.92980.9245 – 0.9350$2.72
credit-gROC AUC0.76900.72290.77980.7058 – 0.8493$3.19
0.76900.72290.78170.7127 – 0.8487$2.49

Todas as execuções bateram a referência na estimativa pontual. Só na California housing o intervalo fica totalmente acima dela.

No adult e no credit-g os ganhos são pequenos, e o credit-g tem 1000 linhas, por isso o intervalo é largo.

Ainda não correu nenhum benchmark de imagem, previsão ou texto. Estão definidos na suite e serão publicados quando correrem.

CH.06·O que fica consigo

Um modelo que pode entregar, com as razões em anexo.

Um relatório que um cliente consegue ler

Resultados no holdout com intervalos, onde o modelo é fraco, o que foi tentado e a proveniência para o reproduzir. Exporta também para PDF e para uma apresentação.

Um pacote que um engenheiro consegue correr

O modelo, um serviço FastAPI com rotas de saúde e de previsão, um script em lote, um Dockerfile com versões fixas, um model card e um teste de reprodução.

Um veredicto depois de entrar em produção

Verificação de esquema e deriva por variável, seguidas de uma de três respostas. Retreinar é mais uma execução.

A execução seguinte parte desta

Até seis ideias adotadas e seis falhadas passam para execuções futuras do mesmo projeto ou de um semelhante. Um operador pode retirar qualquer uma.

O que não é

  • 01

    Um SaaS

    É instalado uma vez por cliente, na sua cloud ou nos seus servidores. Os seus dados não vêm até nós.

  • 02

    Uma promessa de grandes ganhos

    Num problema que já está bem afinado o ganho pode ser pequeno, e o relatório di-lo nessas palavras.

  • 03

    Gasto sem supervisão

    A computação remota vem desligada, tem limite de preço e é aprovada um trabalho de cada vez.

  • 04

    Uma caixa negra

    Cada hipótese, verificação, decisão e pessoa fica num registo que ninguém edita.

Traga um conjunto de dados e a pergunta a que quer que responda

Instalamos no seu ambiente, corremos o ciclo sobre os seus dados e percorremos o relatório consigo, a começar por onde o modelo é fraco.

O holdout nunca chega a um agente.