Caiu ou Não?Pesquisar serviço
PT
Agentes e APIs

OpenAI Ultrafast no GPT-6.1 Sol: como ativar e controlar o custo

O Ultrafast reduz a espera entre tokens, mas usa uma tarifa maior e limites próprios. Aprenda a configurar, medir e decidir onde a velocidade compensa.

Computador exibindo uma requisição da OpenAI API no modo Ultrafast com medição de latência e custo

Resposta rápida

Para usar o Ultrafast com o GPT-6.1 Sol, envie a requisição pela Responses API com model definido como gpt-6.1-sol e service_tier como ultrafast. A modalidade está disponível para usuários da API, sujeita a limites próprios. Para agentes com muitas chamadas de ferramenta, a OpenAI recomenda manter uma conexão WebSocket persistente; HTTP também é compatível.

Ative primeiro em uma rota realmente sensível à latência e compare tempo até o primeiro token, tempo total, qualidade, erros e custo por tarefa. O Ultrafast cobra mais que o processamento Standard. Em 10 de outubro de 2026, a tarifa do GPT-6.1 Sol para contexto curto era de US$ 12 por milhão de tokens de entrada e US$ 60 por milhão de tokens de saída no Ultrafast, contra US$ 2 e US$ 10 no Standard.

O que mudou em 8 de outubro de 2026

A OpenAI adicionou o modo Ultrafast ao GPT-6.1 Sol na Responses API. O parâmetro reduz o intervalo entre tokens gerados e funciona com processamento global, além de residências de dados nos Estados Unidos e na União Europeia, conforme a disponibilidade documentada. O GPT-6 Astra já tinha suporte; a novidade foi estender a opção ao GPT-6.1 Sol.

Ultrafast é uma camada de processamento, não um novo modelo nem uma configuração automática para toda a organização. Cada chamada precisa indicar service_tier: ultrafast. Se o parâmetro for omitido, a requisição seguirá a camada configurada ou padrão aplicável à conta e ao código.

Como ativar pela Responses API

A alteração mínima é incluir service_tier no corpo da chamada. Em JavaScript, use client.responses.create({ model: "gpt-6.1-sol", service_tier: "ultrafast", input: "..." }). Em Python, passe os mesmos campos para client.responses.create. No curl, envie-os no JSON de POST para /v1/responses.

Não trate a resposta como sucesso apenas porque a conexão abriu. Registre o ID da resposta, o service tier devolvido, os tokens de entrada e saída, a duração, o status final e qualquer evento response.failed ou response.incomplete. Isso permite separar ganho de velocidade de falha, interrupção e aumento de custo.

  • Atualize o SDK oficial da OpenAI usado pelo projeto.
  • Confirme que a rota já funciona com gpt-6.1-sol na Responses API.
  • Adicione service_tier: ultrafast somente nessa rota.
  • Faça streaming ou aguarde response.completed antes de marcar a tarefa como concluída.
  • Compare a mesma carga no Standard e no Ultrafast antes de aumentar o tráfego.

Quando usar WebSocket em vez de HTTP

HTTP é suficiente para chamadas independentes e para um teste inicial. Em um agente que alterna modelo e ferramentas várias vezes, cada nova requisição pode acrescentar tempo de conexão e transporte. Por isso, a documentação do Ultrafast recomenda WebSocket persistente para fluxos agentivos com muitas chamadas em sequência.

Na conexão persistente, envie response.create com model, service_tier, input e, quando continuar uma conversa, previous_response_id. Aguarde response.completed antes do próximo turno e trate eventos de erro ou resposta incompleta. Reutilizar o WebSocket reduz overhead de rede, mas não elimina o tempo de ferramentas externas, DNS, banco de dados ou APIs chamadas pelo agente.

Quanto custa o Ultrafast no GPT-6.1 Sol

Os valores oficiais são por milhão de tokens e variam com o tamanho do contexto. Para contexto curto, o Ultrafast custava US$ 12 de entrada, US$ 0,60 de entrada em cache, US$ 15 de gravação no cache e US$ 60 de saída na verificação de 10 de outubro de 2026. Para contexto longo, os valores eram US$ 24, US$ 1,20, US$ 30 e US$ 90, respectivamente.

Para comparação, no Standard de contexto curto o GPT-6.1 Sol custava US$ 2 de entrada, US$ 0,10 de entrada em cache, US$ 2,50 de gravação no cache e US$ 10 de saída. Não estime o orçamento apenas pelo número de chamadas: uma tarefa com contexto grande, raciocínio extenso ou saída longa pode custar muito mais que várias tarefas curtas.

  • Some tokens de entrada, entrada em cache, gravação no cache e saída por tarefa concluída.
  • Multiplique cada grupo pela tarifa do tier e do tamanho de contexto usados.
  • Inclua tentativas, respostas incompletas e chamadas de ferramentas no custo operacional.
  • Compare custo por tarefa bem-sucedida, não apenas custo por requisição.
  • Defina alertas e um teto de gasto antes de ampliar o percentual de tráfego.

Limites próprios e erros 429

O Ultrafast usa limites de taxa separados de Standard e Fast. Para o GPT-6.1 Sol, a documentação listava 1 milhão de tokens por minuto no nível Build, 4 milhões no Launch e 40 milhões no Grow. Esses números são limites padrão do tier, não uma promessa de latência, disponibilidade ou capacidade reservada para cada chamada.

Confira a página de limites da organização antes de migrar tráfego. Ao receber 429, respeite cabeçalhos e aplique backoff com jitter; não repita todas as chamadas imediatamente. Se a aplicação puder tolerar maior espera, implemente uma decisão explícita entre adiar, voltar ao Standard ou recusar temporariamente a tarefa, em vez de esconder a troca de custo e comportamento.

Por que o Ultrafast pode não parecer mais rápido

O ganho do tier atua na geração do modelo. Ele pode ficar oculto se a aplicação gasta mais tempo em abertura de conexão, busca de contexto, serialização, autenticação, consulta a banco, execução de ferramenta ou renderização do cliente. Meça separadamente DNS e TLS, tempo até o primeiro byte, tempo até o primeiro token, duração de cada ferramenta e tempo total até a tarefa estar pronta.

A configuração de raciocínio também importa. O GPT-6.1 Sol não aceita esforço none nem minimal e usa medium por padrão. Reduzir ou aumentar reasoning.effort muda tempo, tokens e qualidade; não confunda essa mudança com o efeito do service tier. Mantenha modelo, prompt, esforço e ferramentas iguais ao comparar Standard e Ultrafast.

  • Execute um conjunto fixo de tarefas representativas nos dois tiers.
  • Registre tempo até o primeiro token e tempo até a resposta completa.
  • Separe a duração de cada ferramenta e dependência externa.
  • Compare tokens, qualidade, erros e custo por tarefa concluída.
  • Repita o teste em horários e volumes diferentes antes de concluir.

Limitações e próxima ação útil

Este guia foi verificado em 10 de outubro de 2026. Preços, limites e disponibilidade podem mudar. Ultrafast não garante que uma aplicação inteira ficará rápida, não substitui streaming, cache, WebSocket ou otimização das ferramentas e não deve ser ativado globalmente sem medição. A página de status mostra incidentes agregados; ela não confirma se a cota, o código ou a rede da sua organização estão corretos.

Escolha uma rota de alto valor em que segundos realmente afetem a experiência. Envie de 20 a 50 tarefas equivalentes por Standard e Ultrafast, preserve modelo e esforço de raciocínio, e compare percentis de latência, qualidade, falhas e custo por conclusão. Só aumente o tráfego se o ganho observado justificar a diferença de tarifa e houver margem nos limites da organização.

Faça o próximo teste

Fontes consultadas

Os links abaixo servem para conferir conceitos, orientações oficiais e o critério editorial usado neste conteúdo.

Outros guias ligados ao mesmo tipo de problema.