Explicação sobre a cobrança escalonada de contexto ultralongo do GPT-5.6 Sol
-
<p>De acordo com as regras de cobrança mais recentes da OpenAI, modelos como o GPT-5.6 Sol utilizam preços escalonados para solicitações com contexto ultralongo.</p><p>Quando o contexto de uma única solicitação ultrapassa 272K tokens, a entrada, a leitura do cache e a saída podem ser calculadas de acordo com um escalão de preço mais alto. Essa regra vem da tabela oficial de preços da OpenAI e não representa um aumento temporário ou uma cobrança anormal do AI-ROUTER.</p><p></p><p>Tomando como exemplo os preços padrão do GPT-5.6 Sol:</p><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> Item Até 272K Acima de 272K</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> ━━━━━━━━━━ ━━━━━━━━━━━━━━━━━━━ ━━━━━━━━━━━━━━━━━</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> Entrada US$ 5 / 1M tokens US$ 10 / 1M tokens</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> ────────── ─────────────────── ─────────────────</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> Leitura do cache US$ 0,50 / 1M tokens US$ 1 / 1M tokens</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> ────────── ─────────────────── ─────────────────</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> Saída US$ 30 / 1M tokens US$ 45 / 1M tokens</code></pre><p></p><p>O custo final ainda será calculado de acordo com o grupo específico, o multiplicador da conta e outras configurações de cobrança.</p><p></p><p>Quando a marca x2 aparece no histórico de uso, isso significa que a solicitação acionou a cobrança escalonada de contexto longo. Essa marca indica principalmente que a entrada e a leitura do cache entraram em um escalão mais alto; ela não significa que todos os custos da solicitação foram simplesmente duplicados. A saída pode usar um multiplicador de escalão diferente.</p><p></p><p><strong>## Como evitar acionar a cobrança escalonada</strong></p><p>Se você não precisa de uma janela de contexto de 1M de tokens, recomendamos ajustar o limite de contexto do Codex para 272K ou menos.</p><p></p><p>Abra:</p><p> ~/.codex/config.toml</p><p></p><p>Altere a configuração de 1M usada no artigo original:</p><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> model = "gpt-5.6-sol"</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> model_context_window = 1000000</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> model_auto_compact_token_limit = 900000</code></pre><p> </p><p>Para:</p><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> model = "gpt-5.6-sol"</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> model_context_window = 272000</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> model_auto_compact_token_limit = 250000</code></pre><p> </p><p>Depois de salvar, reinicie o Codex e crie uma nova sessão.</p><p></p><p>Se quiser aplicar a configuração temporariamente a uma única sessão, use:</p><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>codex -m gpt-5.6-sol -c model_context_window=272000 -c model_auto_compact_token_limit=250000</code></pre><p> Também recomendamos:</p><p> - ativar a compactação automática prontamente;</p><p> - dividir tarefas muito longas em várias sessões;</p><p> - reduzir a quantidade de saída de ferramentas retornada de uma só vez;</p><p> - resumir e limpar regularmente o conteúdo mais antigo da conversa.</p><p></p><p>Se você realmente precisar de uma janela de contexto de 1M de tokens, poderá continuar usando a configuração original, mas o uso acima de 272K será cobrado de acordo com os preços de escalão superior da OpenAI.</p><p></p><p>Para consultar as instruções da configuração original, consulte: <a target="_blank" rel="noopener noreferrer nofollow" href="https://ai-router.dev/blog/post-g-677aa3e043912838-how-to-enable-a-1m-token-context-window-in-codex-for-gpt-5-6-sol">Como ativar uma janela de contexto de 1 milhão de tokens no Codex para o GPT-5.6 Sol </a></p><p></p><p>Agradecemos sua compreensão e apoio.</p>
Hello! It looks like you're interested in this conversation, but you don't have an account yet.
Getting fed up of having to scroll through the same posts each visit? When you register for an account, you'll always come back to exactly where you were before, and choose to be notified of new replies (either via email, or push notification). You'll also be able to save bookmarks and upvote posts to show your appreciation to other community members.
With your input, this post could be even better 💗
Register Login