Alternar tema

FLUX.1 Kontext no ComfyUI: edição em várias etapas e consistência de personagens

Easton editorial illustration: three connected portrait frames showing input, background edit, and clothing edit, a small identity-lock badge spanning all three frames
12B
Escala de parâmetros do Kontext Dev
O model card da BFL descreve o FLUX.1 Kontext Dev como um rectified flow transformer de 12 bilhões de parâmetros.
1.026
Pares de imagem e instrução do KontextBench
O relatório técnico usa 1.026 pares reais de imagem e instrução para avaliar edição, referência de personagem, referência de estilo e edição de texto.
2.5
guidance_scale no exemplo do Diffusers
É um valor inicial do exemplo no model card, não o melhor parâmetro garantido para todos os fluxos do ComfyUI.
数据来源: Model card da BFL e relatório técnico do FLUX.1 Kontext

"O model card do FLUX.1 Kontext Dev da Black Forest Labs descreve os 12B parâmetros, edição sucessiva, uso das saídas e limites da Non-Commercial License."

Uma imagem frontal de uma personagem fictícia já está satisfatória: cabelo curto prateado, olhos âmbar e detalhes corretos na roupa. Na segunda imagem, a única intenção era trocar o palco por uma rua urbana, mas o formato do rosto, a cor do cabelo e a roupa mudaram juntos. Depois de ajustar pose e expressão, a terceira rodada começou a perder nitidez. É nesse ponto que o FLUX.1 Kontext ajuda: ele usa a imagem de entrada como contexto e permite dizer, por texto, o que mudar e o que manter, reduzindo o desvio causado por regenerar a imagem inteira.

Ele não é uma ferramenta de travamento permanente de rosto. A Black Forest Labs mostrou capacidade de manter elementos entre edições, mas também publicou um caso de falha com artefatos e perda de qualidade após seis rodadas. A abordagem mais segura é explorar em sequências curtas, salvar imagens intermediárias e mudar uma variável principal por vez.

Para que o FLUX.1 Kontext serve e quando não usar

FLUX.1 Kontext Dev é um modelo de edição de imagens com 12B parâmetros que recebe ao mesmo tempo uma imagem e instruções de texto. Ele é adequado para trocar fundos, roupas, regiões específicas, estilos e textos, além de continuar uma edição a partir da saída anterior.

NecessidadeComo o Kontext trabalhaO que preservar no promptPrincipal risco
Trocar o fundo e manter a pessoaAlterar somente o fundoface, pose, scale, positionO fundo também altera rosto ou composição
Trocar a roupa e manter o rostoDescrever apenas material e cor da roupafacial features, hairstyle, expressionRoupa e formato do corpo mudam juntos
Mudar o cenário de um produtoReescrever somente o ambienteshape, logo, material, proportionsLogotipo e proporção da embalagem são redesenhados
Criar uma série em várias rodadasAlterar uma dimensão por rodadaRepetir em cada rodada os itens essenciaisPequenos erros se acumulam
Criar um ativo de personagem duradouroUsar o Kontext para explorar direçõesSalvar uma referência limpaMenos estabilidade de longo prazo que uma solução treinada

O Kontext e outros métodos de controle resolvem problemas diferentes. O ControlNet é mais apropriado para fixar pose, profundidade e contorno; o LoRA funciona melhor para reutilizar por longo prazo um personagem ou estilo. IPAdapter injeta condições a partir de uma imagem de referência, enquanto soluções do tipo FaceID priorizam características faciais.

Instalar o Kontext Dev: arquivos e pastas

O tutorial oficial atual do ComfyUI usa como caminho principal um diffusion model FP8 scaled, um VAE e dois text encoders. A página do modelo pode exigir a aceitação prévia dos termos da BFL.

ComfyUI/models/
├── diffusion_models/
│   └── flux1-dev-kontext_fp8_scaled.safetensors
├── text_encoders/
│   ├── clip_l.safetensors
│   └── t5xxl_fp16.safetensors
└── vae/
    └── ae.safetensors

Segundo o tutorial oficial, t5xxl_fp16.safetensors também pode ser substituído por t5xxl_fp8_e4m3fn_scaled.safetensors. Depois de copiar os arquivos, atualize a lista de modelos. Se o loader ainda não os encontrar, verifique o nome das pastas e a integridade dos arquivos e reinicie o ComfyUI. Para problemas gerais de importação e nós ausentes, consulte o guia de reutilização de workflows do ComfyUI.

Abrir o template nativo

Atualize o ComfyUI ou o ComfyUI Desktop e procure Flux.1 Kontext Dev em Workflow Templates. O local e o nome do menu podem mudar com a interface. Se não encontrar o template, atualize antes de instalar pacotes de nós de procedência desconhecida.

Executar a primeira rodada: cadeia de nós e prompt em inglês

O fluxo oficial Dev segue esta sequência:

  1. Em Load Diffusion Model, selecione flux1-dev-kontext_fp8_scaled.safetensors.
  2. Em DualCLIP Load, selecione clip_l.safetensors e o encoder T5.
  3. Em Load VAE, selecione ae.safetensors.
  4. Em Load Image(from output), abra a imagem que será editada.
  5. Escreva o prompt em inglês no CLIP Text Encode.
  6. Clique em Queue ou use Ctrl/Cmd + Enter.

A página oficial atual do ComfyUI ainda informa que esse fluxo Kontext Dev aceita somente prompts em inglês. Não dependa de resultados ocasionais em português. Uma instrução curta e específica em inglês facilita descobrir se a falha está no modelo, no prompt ou no workflow.

Na primeira rodada, mude somente um objeto

Teste primeiro a troca do fundo. Não altere ao mesmo tempo fundo, roupa, pose, idade e estilo. Uma única mudança cria uma referência limpa e mostra qual instrução introduziu o desvio.

Change the background to a city street at night.
Keep the person in the exact same position, scale, and pose.
Preserve the same facial features, hairstyle, expression, and clothing.

Como escrever o prompt: alteração e preservação

Um prompt do Kontext não precisa acumular termos de qualidade. O importante é declarar objeto, ação e invariantes. Palavras como beautiful, better e make it different não definem uma fronteira de edição; change, replace, keep e preserve ajudam o modelo a separar o que muda do que permanece.

CenárioInstrução imprecisaFormulação mais controlável
Trocar o fundoPut her on a beachChange the background to a beach while keeping the same face, pose, scale, and position
Mudar a roupaTransform her into a VikingChange only the clothing to Viking armor while preserving facial features and hairstyle
Alterar a cor do produtoCreate a new bottle designChange only the bottle color to blue; preserve shape, logo placement, material, and proportions
Converter o estiloMake it a sketchConvert to a pencil sketch while maintaining the original composition and subject identity

Termos de preservação para pessoa, produto e composição

O que manterItens que devem aparecer no promptSinal de falha
Identidade da pessoafacial features, hairstyle, expression, body shapeMudança nos olhos, rosto, cabelo ou idade
Forma do produtoshape, logo placement, material, proportionsAlteração na grafia do logotipo, na curva da embalagem ou no material
Composiçãocomposition, camera angle, position, scaleDeslocamento, corte ou perspectiva diferente
Posepose, hand position, body orientationPosição dos membros e contorno se desviam

Quando a pose precisar ser rigorosa, não continue acrescentando mais descrições de pose ao prompt do Kontext. Esse é normalmente o sinal para usar ControlNet.

Edição em várias rodadas: salvar, verificar e reverter

O fluxo usa Load Image(from output) para colocar a saída anterior como entrada da rodada seguinte. Uma ordem prática é fundo, roupa ou acessório, movimento ou expressão leve e, por último, iluminação e estilo.

  1. Salve a imagem de referência sem edição.
  2. Na primeira rodada, troque apenas o fundo e salve round-01.
  3. Na segunda, mude somente roupa ou acessório e salve round-02.
  4. Na terceira, faça uma alteração leve de pose ou expressão.
  5. Só então ajuste estilo, cor ou iluminação.

Quando é obrigatório reverter

Se formato do rosto, olhos, logotipo, proporções do produto ou nitidez piorarem de forma clara, volte à última imagem intermediária limpa. Não acrescente “restaure o rosto” sobre uma imagem já desviada: a nova instrução pode redesenhar regiões adicionais e carregar o erro para a rodada seguinte.

Não existe um número fixo de rodadas seguras. O caso de falha da BFL mostra artefatos visíveis após seis edições, mas isso não significa “cinco são seguras e seis sempre falham”. A imagem de entrada, a amplitude da mudança e as instruções de cada rodada afetam o resultado.

Receitas práticas para consistência de personagens e produtos

Para personagens, descreva características observáveis em vez de usar apenas she ou him:

Change only the background.
Keep the same woman with short silver hair and amber eyes.
Preserve her facial features, hairstyle, expression, body shape, pose, and scale.

Para produtos, liste como invariantes os detalhes sensíveis da marca:

Place the same bottle on a marble counter.
Preserve the exact bottle shape, logo placement, label text, material, proportions, and camera angle.
Change only the environment and surrounding lighting.

Esses prompts reduzem o desvio, mas não substituem a verificação humana. Em imagens comerciais de produtos, revise logotipo, texto, proporções, informações da embalagem e material em cada arquivo. Para pessoas reais, use apenas material próprio ou autorizado.

Como escolher entre Dev, Pro, Max, FP8 e GGUF

OpçãoAcessoUso indicadoAtenção
Kontext DevPesos locais abertosPesquisa, personalização, privacidade local e testes frequentesPesos sujeitos à Non-Commercial License
Kontext ProAPI / Partner NodesEdição comercial e iteração rápidaPreço e termos dependem da plataforma atual
Kontext MaxAPI / Partner NodesMaior obediência às instruções e edição de textoNão equivale aos pesos locais Dev
FP8 scaledCaminho principal do tutorial oficial do ComfyUIExecutar rapidamente com nós nativosMemória suficiente depende do ambiente e da resolução
GGUF / NunchakuImplementações da comunidade ou específicasReduzir uso de VRAM ou acelerarNós, qualidade da quantização e compatibilidade exigem teste

Não trate “12 GB sempre funciona” ou “16 GB sempre é rápido” como requisitos fixos. O consumo também depende de T5, resolução, VAE, preview, offload e outros nós. Para mais detalhes, consulte o guia de baixo uso de VRAM e aceleração no ComfyUI.

Comece a testar o guidance pelo valor do exemplo

O exemplo do Diffusers no model card do Hugging Face usa guidance_scale=2.5. Ele serve como ponto inicial, mas diferentes nós, imagens e áreas de edição no ComfyUI não justificam afirmar que “1.5–2.5 é sempre melhor”. Fixe a entrada e o seed e ajuste apenas um parâmetro por vez.

Ordem de diagnóstico para falhas comuns

SintomaVerifique primeiroPróximo passo
O arquivo não aparece na lista de modelosPasta, nome do arquivo e integridade do downloadAtualize a lista e reinicie
O prompt quase não tem efeitoIdioma inglês e objeto específicoUse change/replace para declarar a alteração
O rosto muda ao trocar o fundoMais de uma dimensão foi alterada?Acrescente face, hairstyle e pose aos itens preservados
A imagem perde nitidez a cada rodadaA saída já desviada continua sendo usada?Volte à última imagem intermediária limpa
O logotipo do produto mudalogo e label foram declarados invariantes?Reduza a área de edição e revise manualmente
Composição ou pose sai do controleÉ necessário controle estrutural forte?Use ou combine ControlNet
VRAM insuficienteFP8, T5, resolução e nós adicionaisReavalie GGUF, offload ou API

Durante o diagnóstico, fixe imagem de entrada e seed e altere apenas o prompt ou um parâmetro. Trocar modelo, quantização, resolução e prompt ao mesmo tempo impede descobrir a causa.

Licença, conformidade e escolha final

Os pesos do FLUX.1 Kontext Dev estão atualmente sujeitos à FLUX.1 dev Non-Commercial License. O model card informa que as saídas geradas podem ter uso pessoal, científico e comercial, mas isso não autoriza integrar diretamente os pesos Dev em um serviço pago. Para implantação comercial, confira o licensing atual da BFL. Pro e Max são produtos de API e seguem os termos da plataforma usada.

A escolha final depende do objetivo:

  • Para trocar fundo, roupa, região específica e explorar conceitos por pouco tempo, comece com Kontext.
  • Para reutilizar de forma duradoura um personagem original ou estilo, use LoRA.
  • Se o objetivo principal for manter o mesmo rosto, avalie soluções do tipo FaceID e trate a autorização de imagem.
  • Quando pose, contorno e composição precisarem permanecer rigorosos, use ControlNet.
  • Para injetar estilo ou assunto de uma referência em uma nova geração, avalie IPAdapter.

Depois da primeira execução, salve a referência e avance na ordem “fundo → roupa → movimento leve → iluminação ou estilo”. A vantagem do Kontext não é prometer ausência de desvio, mas dar contexto claro a cada alteração e permitir voltar ao último estado limpo quando algo sair do esperado.

Fazer uma edição Kontext em várias etapas com possibilidade de reversão

Execute primeiro o template oficial Dev, altere uma variável por rodada e descreva claramente o que deve ser preservado em personagens, produtos e composição.

  1. 1

    Step 1: Atualizar e abrir o template

    Atualize o ComfyUI e procure Flux.1 Kontext Dev em Workflow Templates. Se o template não aparecer, confirme a versão instalada.
  2. 2

    Step 2: Colocar os arquivos dos modelos

    Instale diffusion model, VAE e text encoders CLIP/T5 nas pastas correspondentes; depois atualize ou reinicie e confirme que os loaders encontram os arquivos.
  3. 3

    Step 3: Importar a imagem de referência

    Abra uma imagem própria ou autorizada em Load Image(from output) e salve uma cópia da referência ainda não editada.
  4. 4

    Step 4: Começar com uma única variável

    No CLIP Text Encode, descreva em inglês o objeto a alterar e liste rosto, pose, proporções ou composição que precisam permanecer iguais.
  5. 5

    Step 5: Salvar a saída da primeira rodada

    Verifique rosto, cabelo, logotipo, material, posição e nitidez; só use a saída na próxima rodada depois de aprová-la.
  6. 6

    Step 6: Adicionar mudanças gradualmente

    Avance na ordem fundo, roupa ou acessório, movimento leve, iluminação ou estilo, alterando apenas uma dimensão principal por rodada.
  7. 7

    Step 7: Reverter ao primeiro sinal de desvio

    Se rosto, proporções do produto, logotipo ou nitidez piorarem, volte à última saída limpa, reduza a mudança e tente novamente.
  8. 8

    Step 8: Decidir se é hora de trocar de método

    Para reutilização duradoura de personagens, travamento rigoroso de rosto ou controle preciso de pose, avalie LoRA, soluções do tipo FaceID ou ControlNet.

FAQ

Qual é a diferença entre FLUX.1 Kontext e LoRA?
O Kontext edita imediatamente a partir de uma imagem e instruções, sem treinamento prévio. LoRA exige pesos preparados ou treinados, mas é mais adequado para reutilizar por longo prazo um personagem, produto ou estilo fixo.
Onde colocar os arquivos do Kontext Dev no ComfyUI?
Coloque o diffusion model em models/diffusion_models/, o ae.safetensors em models/vae/ e os text encoders clip_l e t5xxl em models/text_encoders/.
Como reduzir mudanças no rosto com FLUX Kontext?
Altere apenas uma dimensão por rodada e peça para preservar facial features, hairstyle, expression, pose e scale. Se a identidade já mudou, volte à imagem intermediária anterior.
O prompt do Kontext Dev pode ser escrito em português?
A documentação atual do fluxo oficial Kontext Dev no ComfyUI ainda informa que o CLIP Text Encode aceita apenas prompts em inglês. Para esse fluxo nativo, use instruções diretas em inglês.
Por que a imagem perde nitidez após várias edições?
Cada rodada carrega erros da saída anterior, e sequências longas podem introduzir artefatos. Salve versões intermediárias, reduza o escopo de cada alteração e volte assim que notar desvio.
FLUX.1 Kontext Dev pode ser usado comercialmente?
Os pesos estão sujeitos à FLUX.1 dev Non-Commercial License. Para uma implantação comercial, confira a licença atual da BFL; direitos sobre a saída gerada e direitos de uso dos pesos são questões diferentes.

10 min de leitura · Publicado em: 21 ago 2026 · Atualizado em: 21 ago 2026

Comentários

Entre com GitHub para comentar

Easton BlogEaston Blog