‘Hi’만 보냈는데도 수천 개의 토큰이 소모될 수 있는 이유
-
소개
최근 일부 사용자는 다음과 같은 의아한 상황을 발견했습니다:
‘Hi’만 보냈는데 왜 10,000개 이상의 토큰이 소모되나요?
처음 보면 다소 예상 밖으로 느껴질 수 있습니다. 두 글자짜리 메시지라면 몇 개의 토큰만 필요할 것 같지 않나요?
정답은 다음과 같습니다: 모델은 사용자가 눈에 보이는 메시지만 처리하는 것이 아닙니다.
Codex, Claude Code, 그리고 기타 IDE 기반 AI 도구와 같은 최신 AI 어시스턴트, 특히 코딩 에이전트는 모델이 작업을 이해하고 더 나은 응답을 제공할 수 있도록 사용자의 메시지와 함께 훨씬 더 많은 정보를 전송합니다.
사용자의 메시지는 전체 컨텍스트의 일부분일 뿐입니다
사용자가 다음과 같이 보내면:
<pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>Hi</code></pre>AI 모델에 실제로 전송되는 요청은 다음과 더 비슷할 수 있습니다:
<pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>시스템 지침 + 사용자 설정 + 구성된 스킬 + 사용 가능한 도구 + 프로젝트 정보 + 파일 컨텍스트 + 이전 대화 기록 + 사용자 메시지: "Hi"</code></pre>이 모든 구성 요소의 총합이 모델이 실제로 처리하는 컨텍스트입니다.
따라서 아주 짧은 메시지라도 상당한 수의 토큰을 소모할 수 있습니다.
무엇이 컨텍스트 사용량을 증가시킬 수 있을까요?
1. 구성된 스킬
사용자가 커스텀 스킬이나 AI 기능을 활성화했다면, 그 지침도 모델 컨텍스트에 로드되어야 합니다.
예를 들어:
<pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>스킬 A 지침: 2,000 토큰 스킬 B 지침: 3,000 토큰 스킬 C 지침: 1,500 토큰</code></pre>사용자가 아무것도 입력하기 전부터 이러한 지침만으로도 이미 수천 개의 토큰을 차지할 수 있습니다.
2. 도구와 에이전트 기능
AI 코딩 어시스턴트는 보통 다음과 같은 도구를 제공합니다:
- 파일 읽기
- 코드 검색
- 터미널 실행
- Git 작업
- 브라우저 접근
- 외부 연동
이러한 도구의 정의와 사용 지침 역시 컨텍스트 공간을 소모합니다.
3. 프로젝트 및 파일 컨텍스트
IDE나 코드 저장소 내부에서 작업할 때, AI 클라이언트는 자동으로 다음을 포함할 수 있습니다:
- 프로젝트 구조
- 열려 있는 파일
- 코드 조각
- 의존성
- 구성 파일
이 덕분에 AI가 프로젝트를 더 잘 이해할 수 있지만, 동시에 컨텍스트 사용량도 증가합니다.
4. 이전 대화 기록
기존 대화를 이어갈 경우, 모델이 문맥을 이해할 수 있도록 이전 메시지들이 다시 함께 포함되는 경우가 많습니다.
예를 들어:
<pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>이전 대화: 12,000 토큰 새 메시지: Hi</code></pre>새 요청에도 여전히 이전의 12,000토큰이 포함될 수 있습니다.
최소 토큰 사용량을 테스트하는 방법
단순한 메시지의 토큰 사용량을 측정하고 싶다면, 다음과 같이 해보세요:
- 완전히 새로운 대화를 시작합니다.
- 커스텀 스킬을 비활성화합니다.
- 파일을 첨부하지 않습니다.
- 프로젝트 워크스페이스를 열지 않습니다.
- 다음만 전송합니다:
<pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>Hi</code></pre>이렇게 하면 대략적인 최소 컨텍스트 사용량을 확인할 수 있습니다.
컨텍스트 윈도우와 토큰 사용량의 차이
다음 두 개념은 구분해서 이해하는 것이 중요합니다:
컨텍스트 윈도우
모델이 한 번의 요청에서 처리할 수 있는 정보의 최대량입니다.
예시:
<pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>100만 토큰 컨텍스트 윈도우</code></pre>이는 모델이 이론상 최대 100만 토큰까지 처리할 수 있음을 의미합니다.
토큰 사용량
특정 요청에 실제로 포함된 토큰의 양입니다.
예시:
<pre class="rounded-lg bg-slate-950 px-4 py-3 text-slate-100"><code>사용자 메시지: Hi 실제 요청: 시스템 지침 + 도구 + 기록 + "Hi" 총합: 15,000 토큰</code></pre>컨텍스트 윈도우가 크다고 해서 모든 요청이 사용자의 메시지 길이만큼만 소모된다는 뜻은 아닙니다.
결론
짧은 메시지에서 높은 토큰 사용량이 발생한다고 해서 반드시 모델이나 API에 문제가 있다는 뜻은 아닙니다.
AI 에이전트 환경에서는 전체 컨텍스트에 지능적인 동작을 위해 필요한 여러 숨겨진 구성 요소가 포함됩니다. 세션에 스킬, 도구, 프로젝트 정보, 이전 기록이 있다면 단순한 ‘Hi’도 수천 개의 토큰 처리를 유발할 수 있습니다.
순수한 토큰 사용량을 테스트할 때는 추가 컨텍스트 없이 깨끗한 세션에서 시작하는 것을 권장합니다.
이해와 지속적인 지원에 감사드립니다.
Hello! It looks like you're interested in this conversation, but you don't have an account yet.
Getting fed up of having to scroll through the same posts each visit? When you register for an account, you'll always come back to exactly where you were before, and choose to be notified of new replies (either via email, or push notification). You'll also be able to save bookmarks and upvote posts to show your appreciation to other community members.
With your input, this post could be even better 💗
Register Login