Resposta rápida
Para usar o Ultrafast com o GPT-6.1 Sol, envie a requisição pela Responses API com model definido como gpt-6.1-sol e service_tier como ultrafast. A modalidade está disponível para usuários da API, sujeita a limites próprios. Para agentes com muitas chamadas de ferramenta, a OpenAI recomenda manter uma conexão WebSocket persistente; HTTP também é compatível.
Ative primeiro em uma rota realmente sensível à latência e compare tempo até o primeiro token, tempo total, qualidade, erros e custo por tarefa. O Ultrafast cobra mais que o processamento Standard. Em 10 de outubro de 2026, a tarifa do GPT-6.1 Sol para contexto curto era de US$ 12 por milhão de tokens de entrada e US$ 60 por milhão de tokens de saída no Ultrafast, contra US$ 2 e US$ 10 no Standard.
O que mudou em 8 de outubro de 2026
A OpenAI adicionou o modo Ultrafast ao GPT-6.1 Sol na Responses API. O parâmetro reduz o intervalo entre tokens gerados e funciona com processamento global, além de residências de dados nos Estados Unidos e na União Europeia, conforme a disponibilidade documentada. O GPT-6 Astra já tinha suporte; a novidade foi estender a opção ao GPT-6.1 Sol.
Ultrafast é uma camada de processamento, não um novo modelo nem uma configuração automática para toda a organização. Cada chamada precisa indicar service_tier: ultrafast. Se o parâmetro for omitido, a requisição seguirá a camada configurada ou padrão aplicável à conta e ao código.
Como ativar pela Responses API
A alteração mínima é incluir service_tier no corpo da chamada. Em JavaScript, use client.responses.create({ model: "gpt-6.1-sol", service_tier: "ultrafast", input: "..." }). Em Python, passe os mesmos campos para client.responses.create. No curl, envie-os no JSON de POST para /v1/responses.
Não trate a resposta como sucesso apenas porque a conexão abriu. Registre o ID da resposta, o service tier devolvido, os tokens de entrada e saída, a duração, o status final e qualquer evento response.failed ou response.incomplete. Isso permite separar ganho de velocidade de falha, interrupção e aumento de custo.
- Atualize o SDK oficial da OpenAI usado pelo projeto.
- Confirme que a rota já funciona com gpt-6.1-sol na Responses API.
- Adicione service_tier: ultrafast somente nessa rota.
- Faça streaming ou aguarde response.completed antes de marcar a tarefa como concluída.
- Compare a mesma carga no Standard e no Ultrafast antes de aumentar o tráfego.
Quando usar WebSocket em vez de HTTP
HTTP é suficiente para chamadas independentes e para um teste inicial. Em um agente que alterna modelo e ferramentas várias vezes, cada nova requisição pode acrescentar tempo de conexão e transporte. Por isso, a documentação do Ultrafast recomenda WebSocket persistente para fluxos agentivos com muitas chamadas em sequência.
Na conexão persistente, envie response.create com model, service_tier, input e, quando continuar uma conversa, previous_response_id. Aguarde response.completed antes do próximo turno e trate eventos de erro ou resposta incompleta. Reutilizar o WebSocket reduz overhead de rede, mas não elimina o tempo de ferramentas externas, DNS, banco de dados ou APIs chamadas pelo agente.
Quanto custa o Ultrafast no GPT-6.1 Sol
Os valores oficiais são por milhão de tokens e variam com o tamanho do contexto. Para contexto curto, o Ultrafast custava US$ 12 de entrada, US$ 0,60 de entrada em cache, US$ 15 de gravação no cache e US$ 60 de saída na verificação de 10 de outubro de 2026. Para contexto longo, os valores eram US$ 24, US$ 1,20, US$ 30 e US$ 90, respectivamente.
Para comparação, no Standard de contexto curto o GPT-6.1 Sol custava US$ 2 de entrada, US$ 0,10 de entrada em cache, US$ 2,50 de gravação no cache e US$ 10 de saída. Não estime o orçamento apenas pelo número de chamadas: uma tarefa com contexto grande, raciocínio extenso ou saída longa pode custar muito mais que várias tarefas curtas.
- Some tokens de entrada, entrada em cache, gravação no cache e saída por tarefa concluída.
- Multiplique cada grupo pela tarifa do tier e do tamanho de contexto usados.
- Inclua tentativas, respostas incompletas e chamadas de ferramentas no custo operacional.
- Compare custo por tarefa bem-sucedida, não apenas custo por requisição.
- Defina alertas e um teto de gasto antes de ampliar o percentual de tráfego.
Limites próprios e erros 429
O Ultrafast usa limites de taxa separados de Standard e Fast. Para o GPT-6.1 Sol, a documentação listava 1 milhão de tokens por minuto no nível Build, 4 milhões no Launch e 40 milhões no Grow. Esses números são limites padrão do tier, não uma promessa de latência, disponibilidade ou capacidade reservada para cada chamada.
Confira a página de limites da organização antes de migrar tráfego. Ao receber 429, respeite cabeçalhos e aplique backoff com jitter; não repita todas as chamadas imediatamente. Se a aplicação puder tolerar maior espera, implemente uma decisão explícita entre adiar, voltar ao Standard ou recusar temporariamente a tarefa, em vez de esconder a troca de custo e comportamento.
Por que o Ultrafast pode não parecer mais rápido
O ganho do tier atua na geração do modelo. Ele pode ficar oculto se a aplicação gasta mais tempo em abertura de conexão, busca de contexto, serialização, autenticação, consulta a banco, execução de ferramenta ou renderização do cliente. Meça separadamente DNS e TLS, tempo até o primeiro byte, tempo até o primeiro token, duração de cada ferramenta e tempo total até a tarefa estar pronta.
A configuração de raciocínio também importa. O GPT-6.1 Sol não aceita esforço none nem minimal e usa medium por padrão. Reduzir ou aumentar reasoning.effort muda tempo, tokens e qualidade; não confunda essa mudança com o efeito do service tier. Mantenha modelo, prompt, esforço e ferramentas iguais ao comparar Standard e Ultrafast.
- Execute um conjunto fixo de tarefas representativas nos dois tiers.
- Registre tempo até o primeiro token e tempo até a resposta completa.
- Separe a duração de cada ferramenta e dependência externa.
- Compare tokens, qualidade, erros e custo por tarefa concluída.
- Repita o teste em horários e volumes diferentes antes de concluir.
Limitações e próxima ação útil
Este guia foi verificado em 10 de outubro de 2026. Preços, limites e disponibilidade podem mudar. Ultrafast não garante que uma aplicação inteira ficará rápida, não substitui streaming, cache, WebSocket ou otimização das ferramentas e não deve ser ativado globalmente sem medição. A página de status mostra incidentes agregados; ela não confirma se a cota, o código ou a rede da sua organização estão corretos.
Escolha uma rota de alto valor em que segundos realmente afetem a experiência. Envie de 20 a 50 tarefas equivalentes por Standard e Ultrafast, preserve modelo e esforço de raciocínio, e compare percentis de latência, qualidade, falhas e custo por conclusão. Só aumente o tráfego se o ganho observado justificar a diferença de tarifa e houver margem nos limites da organização.
Faça o próximo teste
Fontes consultadas
Os links abaixo servem para conferir conceitos, orientações oficiais e o critério editorial usado neste conteúdo.
- Changelog da OpenAI APIOpenAI API Docs
- Ultrafast modeOpenAI API Docs
- WebSocket ModeOpenAI API Docs
- Reasoning modelsOpenAI API Docs
- PricingOpenAI API Docs
