A equipe Qwen da Alibaba lançou o Qwen-Image-2.1-Turbo, um checkpoint acelerado do modelo aberto Qwen-Image-2.1 que gera e edita imagens em resolução 2K em apenas 8 passos de desruído, contra os 40 do modelo base — uma redução de 5x nos passos de inferência sem perda aparente de qualidade.

O que muda no Turbo

O Turbo mantém a mesma arquitetura de 7B parâmetros (single-stream DiT com 32 camadas e atenção bloco-causal), o mesmo text encoder Qwen3-VL 8B e o mesmo VAE de 64 canais com compressão espacial 16x que habilita transparência RGBA nativa. A diferença está no agendamento de amostragem: o checkpoint inclui um schedule de 8 passos otimizado, com CFG=1 e prefix KV caching que reutiliza o contexto de texto e imagem de referência entre os passos.

Na prática, o cache prefixo cobre a maior parte do custo de condicionamento. Com apenas 8 passos, a vantagem é ainda mais expressiva do que seria em 40.

O que ele faz

O model card cobre 8 categorias: retratos, poses humanas, imagens transparentes, tipografia e pôsteres, layouts de UI, transformação de imagem única, composição multi-referência (até 10 referências) e composição de interiores com 4 imagens. Edição local via círculos, anotações pintadas ou máscaras também é suportada.

Como rodar

Requer Diffusers instalado da fonte (com o PR #14950 que adiciona sampling sigmas configurável) e transformers>=5.17.0. O código é simples:

from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")
image = pipe(
    prompt="A ceramic teapot on a wooden table, soft window light",
    width=2048, height=2048, use_kv_cache=True,
).images[0]

A Unsloth estima que o modelo base roda com ~11 GB de VRAM em GGUF e ~24 GB em INT8/FP8. A Alibaba não publica um mínimo de VRAM para o Turbo.

API e preço

O Alibaba Cloud Model Studio hospeda ambos os modelos. O qwen-image-2.1-turbo custa CNY 0.10 por imagem (~US$ 0.014) com limite de 120 RPM. O qwen-image-2.1-pro custa CNY 0.25 por imagem com 20 RPM. O Turbo é 2.5x mais barato por imagem e permite 6x mais requisições por minuto.

Comparação com concorrentes rápidos

Qwen-Image-2.1-Turbo FLUX.2 klein 9B Z-Image-Turbo
Gerações 8 4 8 NFEs
Parâmetros 7B 9B 6B
Edição multi-ref Sim (até 10) Sim Não
Transparência RGBA Sim Não divulgado Não divulgado
Resolução nativa 2048x2048 1024x1024 1024x1024
Aberto Sim (licença de pesquisa) Sim Sim

Por que importa

O Qwen-Image-2.1-Turbo posiciona a Alibaba na frente em velocidade + qualidade + edição para modelos abertos de geração de imagem. A combinação de 8 passos, 2K nativo, transparência e edição multi-referência é rara entre modelos open-weight. O preço da API (CNY 0.10) torna-o uma opção viável para pipelines de geração em escala.

A ressalva é a licença: o modelo usa uma licença de pesquisa, então uso comercial auto-hospedado requer permissão separada da Alibaba.

Fontes: MarkTechPost — Qwen-Image-2.1-Turbo. Hugging Face — Qwen/Qwen-Image-2.1-Turbo. Alibaba Cloud Model Studio.

Fontes e referências

Eric
Eric

Editor responsável pela Gbyte News.

Mais deste colunista ↗

Encontrou uma informação que precisa de correção? Fale com a redação.