Dosdadosembrutoaummodeloqueconseguedefender.
Um agente corre o ciclo de machine learning dentro do seu ambiente, uma ideia por sessão isolada. Um orquestrador que o agente não controla pontua, verifica e julga cada resultado.
melhor ROC AUC em validação cruzada
0.8412+0.0391 face à linha de base
melhor até agora, por iteração
- adotado
- não significativo
- rejeitado
- linha de base
gasto em LLM
1,84 $ / 5,00 $
computação
2,1 h / 6 h
iterações
12 / 20
tempo decorrido
1 h 52 / 4 h
fluxo de eventos
CH.01·O problema
Um modelo que se avalia a si próprio é um modelo que ninguém consegue verificar.
Um agente de programação constrói um modelo numa tarde. Sozinho, também escolhe a semente, reporta a própria pontuação e pode abrir o conjunto de teste.
CH.02·Siga uma execução
Uma execução, de uma fonte de dados a uma pontuação no holdout.
Cada experiência é uma sessão nova de um agente, numa sandbox. Tudo o que acontece entre sessões pertence ao orquestrador.
CH.03·O juiz
Os agentes propõem. O orquestrador julga.
O agente escreve o modelo. O harness avalia-o, com regras que o agente não contorna nem altera.
Todas as ideias, nos mesmos folds
MAQUETA · DADOS DE EXEMPLOA melhor pontuação só muda quando um ganho é adotado. As ideias dentro do ruído ficam no gráfico, esbatidas, para que nada do que foi tentado fique escondido.
- adotado
- não significativo
- rejeitado
- linha de base
Sete verificações antes de algo contar
- schemao resultado é um result/v1 válido
- contracto entrypoint cumpre o contrato
- gito commit é o HEAD e a árvore está limpa
- mlflowo run está na experiência desta execução
- featuresnenhuma variável proibida foi usada
- seed_enva semente e o hash do ambiente coincidem
- isolationcada fold foi treinado isolado
Um ganho tem de passar um teste
Teste t emparelhado com reamostragem e a correção de Nadeau–Bengio, unilateral, α 0,05. A correção compensa folds que partilham linhas de treino.
Para por regra
Paciência sobre os ganhos adotados, mais orçamentos de gasto em LLM, computação e tempo. Antes de parar, pode pedir a si próprio uma direção diferente.
MAQUETA · DADOS DE EXEMPLO
Procura onde está a errar
Os segmentos onde o melhor modelo erra de forma significativa voltam ao briefing seguinte, como a primeira coisa que o agente lê.
CH.04·Controlo
A sua equipa conduz. O sistema pergunta antes de gastar.
Três modos de autonomia e uma consola que pode pausar, orientar, vetar ou parar uma execução a qualquer momento.
Autonomia
- AutónomoCorre o ciclo dentro dos orçamentos.
- Com aprovaçãoPergunta antes de cada trabalho remoto e mostra exatamente que dados saem.
- SupervisionadoPergunta antes de cada hipótese.
Nota de orientação
“Experimenta restrições monótonas na antiguidade antes de juntar mais árvores.”
Ana · operadora · 10:42
- pausar
- parar
- vetar uma ideia
- editar orçamentos
- promover com um motivo
Conduza-o a partir do Claude Code
Um servidor MCP de operação com 23 ferramentas, atrás do mesmo login e do mesmo registo de auditoria que o cockpit.
❯ claude mcp add --transport http \
auto-ml-scientist \
https://<your-host>/operator/mcp/
✓ 23 tools
Cada decisão, com hora e autor
Aprovações, vetos, notas e promoções ficam num registo só de acréscimo, com a pessoa e o minuto.
- 10:42Ananota de orientação adicionada
- 10:47Anatrabalho remoto aprovado · limite 4,00 $
- 11:03Ruihipótese H-09 vetada
- 11:58Ruiiteração 11 promovida · com motivo
CH.05·Resultados
Oito execuções em dados públicos, com os intervalos à vista.
Quatro conjuntos de dados públicos, duas execuções cada, com o claude-opus-5-5 em outubro de 2026. A referência é um LightGBM com definições padrão, pontuado no mesmo holdout.
- Auto ML Scientist, com o intervalo de 95%
- a sua linha de base
- referência: LightGBM padrão
california-housing
RMSE · menor é melhor
0.47310.3883 · 0.38300.3552bank-marketing
PR AUC · maior é melhor
0.60960.6648 · 0.64720.7033adult
ROC AUC · maior é melhor
0.92340.9295 · 0.92980.9359credit-g
ROC AUC · maior é melhor
0.69430.7798 · 0.78170.8608
- gasto em LLM por execução
- 2,27 $ a 3,34 $
- tempo por execução
- 31 a 141 min
- iterações por execução
- 5 a 7
Ver os números numa tabela
| conjunto de dados | métrica | linha de base | referência | execução | intervalo de 95% | gasto em LLM |
|---|---|---|---|---|---|---|
| california-housing | RMSE | 0.4650 | 0.4635 | 0.3883 | 0.3698 – 0.4069 | $2.57 |
| 0.4650 | 0.4635 | 0.3830 | 0.3633 – 0.4032 | $2.58 | ||
| bank-marketing | PR AUC | 0.6330 | 0.6304 | 0.6648 | 0.6329 – 0.6968 | $3.34 |
| 0.6330 | 0.6304 | 0.6472 | 0.6161 – 0.6783 | $2.51 | ||
| adult | ROC AUC | 0.9263 | 0.9270 | 0.9295 | 0.9243 – 0.9347 | $2.27 |
| 0.9263 | 0.9270 | 0.9298 | 0.9245 – 0.9350 | $2.72 | ||
| credit-g | ROC AUC | 0.7690 | 0.7229 | 0.7798 | 0.7058 – 0.8493 | $3.19 |
| 0.7690 | 0.7229 | 0.7817 | 0.7127 – 0.8487 | $2.49 |
Todas as execuções bateram a referência na estimativa pontual. Só na California housing o intervalo fica totalmente acima dela.
No adult e no credit-g os ganhos são pequenos, e o credit-g tem 1000 linhas, por isso o intervalo é largo.
Ainda não correu nenhum benchmark de imagem, previsão ou texto. Estão definidos na suite e serão publicados quando correrem.
CH.06·O que fica consigo
Um modelo que pode entregar, com as razões em anexo.
Um relatório que um cliente consegue ler
Resultados no holdout com intervalos, onde o modelo é fraco, o que foi tentado e a proveniência para o reproduzir. Exporta também para PDF e para uma apresentação.
Um pacote que um engenheiro consegue correr
O modelo, um serviço FastAPI com rotas de saúde e de previsão, um script em lote, um Dockerfile com versões fixas, um model card e um teste de reprodução.
Um veredicto depois de entrar em produção
Verificação de esquema e deriva por variável, seguidas de uma de três respostas. Retreinar é mais uma execução.
A execução seguinte parte desta
Até seis ideias adotadas e seis falhadas passam para execuções futuras do mesmo projeto ou de um semelhante. Um operador pode retirar qualquer uma.
O que não é
- 01
Um SaaS
É instalado uma vez por cliente, na sua cloud ou nos seus servidores. Os seus dados não vêm até nós.
- 02
Uma promessa de grandes ganhos
Num problema que já está bem afinado o ganho pode ser pequeno, e o relatório di-lo nessas palavras.
- 03
Gasto sem supervisão
A computação remota vem desligada, tem limite de preço e é aprovada um trabalho de cada vez.
- 04
Uma caixa negra
Cada hipótese, verificação, decisão e pessoa fica num registo que ninguém edita.
Traga um conjunto de dados e a pergunta a que quer que responda
Instalamos no seu ambiente, corremos o ciclo sobre os seus dados e percorremos o relatório consigo, a começar por onde o modelo é fraco.
O holdout nunca chega a um agente.