Explicação sobre a cobrança escalonada de contexto ultralongo do GPT-5.6 Sol
-
<p>De acordo com as regras de cobrança mais recentes da OpenAI, modelos como o GPT-5.6 Sol adotam preços escalonados para solicitações com contexto ultralongo.</p><p>Quando o contexto de uma única solicitação ultrapassa 272K tokens, a entrada, a leitura do cache e a saída podem ser calculadas de acordo com uma faixa de preço superior. Essa regra vem da tabela oficial de preços da OpenAI e não representa um aumento temporário ou uma cobrança anormal do AI-ROUTER.</p><p></p><p>Usando o preço padrão do GPT-5.6 Sol como exemplo:</p><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> Item Até 272K Acima de 272K</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> ━━━━━━━━━━ ━━━━━━━━━━━━━━━━━━━ ━━━━━━━━━━━━━━━━━</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> Entrada $5 / 1M tokens $10 / 1M tokens</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> ────────── ─────────────────── ─────────────────</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> Leitura do cache $0.50 / 1M tokens $1 / 1M tokens</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> ────────── ─────────────────── ─────────────────</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> Saída $30 / 1M tokens $45 / 1M tokens</code></pre><p></p><p>O custo final ainda será calculado de acordo com o grupo específico, o multiplicador da conta e outras configurações de cobrança.</p><p></p><p>Quando a marca x2 aparece no histórico de uso, isso indica que a solicitação acionou a cobrança escalonada de contexto longo. Essa marca indica principalmente que a entrada ou a leitura do cache entrou em uma faixa superior; ela não significa que todos os custos da solicitação foram simplesmente duplicados. A saída pode usar um multiplicador de faixa diferente.</p><p></p><p><strong> ## Como evitar acionar a cobrança escalonada</strong></p><p>Se você não precisa de uma janela de contexto de 1M de tokens, recomendamos ajustar o limite de contexto do Codex para até 272K.</p><p></p><p>Abra:</p><p> ~/.codex/config.toml</p><p></p><p>Altere a configuração de 1M usada no artigo original:</p><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> model = "gpt-5.6-sol"</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> model_context_window = 1000000</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> model_auto_compact_token_limit = 900000</code></pre><p> </p><p>Para:</p><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> model = "gpt-5.6-sol"</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> model_context_window = 272000</code></pre><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code> model_auto_compact_token_limit = 250000</code></pre><p> </p><p>Salve, reinicie o Codex e crie uma nova sessão.</p><p></p><p>Se quiser aplicar a configuração temporariamente a uma única sessão, use:</p><pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>codex -m gpt-5.6-sol -c model_context_window=272000 -c model_auto_compact_token_limit=250000</code></pre><p> Também recomendamos:</p><p> - ativar a compactação automática no momento adequado;</p><p> - dividir tarefas muito longas em várias sessões;</p><p> - reduzir a quantidade de saída de ferramentas retornada de uma só vez;</p><p> - resumir periodicamente e limpar o conteúdo mais antigo da conversa.</p><p></p><p>Se você realmente precisa de uma janela de contexto de 1M de tokens, pode continuar usando a configuração original, mas o uso acima de 272K será cobrado de acordo com os preços das faixas superiores da OpenAI.</p><p></p><p>Para consultar as instruções da configuração original, veja: <a target="_blank" rel="noopener noreferrer nofollow" href="https://ai-router.dev/blog/post-g-677aa3e043912838-how-to-enable-a-1m-token-context-window-in-codex-for-gpt-5-6-sol">Como ativar uma janela de contexto de 1 milhão de tokens no Codex para o GPT-5.6 Sol </a></p><p></p><p>Agradecemos sua compreensão e seu apoio.</p>
Hello! It looks like you're interested in this conversation, but you don't have an account yet.
Getting fed up of having to scroll through the same posts each visit? When you register for an account, you'll always come back to exactly where you were before, and choose to be notified of new replies (either via email, or push notification). You'll also be able to save bookmarks and upvote posts to show your appreciation to other community members.
With your input, this post could be even better 💗
Register Login