예시
입력
모델: GPT-4o · 텍스트: "안녕하세요, 반갑습니다."
출력
토큰 12 · 글자 13 · 컨텍스트 128K 대비 0.01% · 예상 입력 비용 표시
참고
같은 문장이라도 모델마다 어휘 사전이 달라 토큰 수가 달라집니다. GPT 계열은 tiktoken 이 공개되어 API 와 같은 값이지만, Claude · Gemini 는 토크나이저가 비공개라 추정치입니다.
사용법 / 자주 묻는 질문
이런 경우 사용하세요
- 프롬프트가 모델 컨텍스트 한도에 들어가는지 보내기 전에 확인
- 긴 문서를 청크로 나눌 때 청크 크기를 토큰 기준으로 잡기
- API 호출 비용을 대략 계산해 예산 잡기
- 같은 내용을 한국어 · 영어로 썼을 때 토큰 수 차이 비교
- RAG 파이프라인에서 컨텍스트에 넣을 문서 개수 정하기
자주 묻는 질문
- Q.왜 모델마다 토큰 수가 다른가요?
- A.토크나이저마다 어휘 사전이 다르기 때문입니다. 같은 OpenAI 안에서도 GPT-4 는 cl100k_base, GPT-4o 는 o200k_base 를 쓰고, 어휘가 커질수록 같은 문장이 더 적은 토큰으로 쪼개집니다.
- Q.'정확' 과 '추정' 은 무슨 차이인가요?
- A.OpenAI 는 tiktoken 을 공개해 두어 브라우저에서 API 와 동일한 값을 계산할 수 있습니다. Claude · Gemini 는 토크나이저가 비공개라 GPT 토큰 수에 보정 배수를 적용한 근사치를 보여 줍니다 — 정확한 값이 필요하면 각사의 토큰 카운트 API 를 쓰세요.
- Q.표시된 토큰 수가 실제 청구와 다릅니다.
- A.여기 표시되는 값은 입력한 raw 텍스트 기준입니다. 실제 API 호출에는 메시지 포맷(role · system 프롬프트 · 도구 정의)의 오버헤드가 더해지고 출력 토큰도 별도로 과금되므로, 실사용량은 이보다 큽니다.
- Q.한국어가 영어보다 토큰을 많이 쓰나요?
- A.일반적으로 그렇습니다. 주요 토크나이저의 어휘 사전이 영어 텍스트에 맞춰 학습돼 영어는 단어 하나가 토큰 하나로 떨어지는 경우가 많지만, 한국어는 한 단어가 여러 조각으로 쪼개지기 쉽습니다. 같은 내용을 담아도 비용과 컨텍스트 소모가 커지는 이유입니다.
재미있는 사실
오늘날 LLM 토크나이저의 기반인 BPE(Byte Pair Encoding)는 원래 1994년에 나온 데이터 압축 알고리즘이었습니다. 2016년 Sennrich 등이 기계번역의 미등록 단어 문제를 풀려고 이 압축 기법을 가져다 쓰면서 자연어 처리의 표준이 됐습니다.
arXiv — Neural Machine Translation of Rare Words with Subword Units같은 내용을 써도 언어에 따라 토큰 수가 크게 차이 납니다. 2023년 연구는 주요 상용 토크나이저에서 언어별 토큰 수가 최대 15배까지 벌어질 수 있음을 보였는데, 토큰 단위로 과금하는 API 에서는 이 차이가 그대로 비용 차이가 됩니다.
arXiv — Language Model Tokenizers Introduce Unfairness Between LanguagesOpenAI 의 tiktoken 은 모델별로 다른 어휘 사전을 씁니다 — GPT-3.5/4 는 약 10만 개의 cl100k_base, GPT-4o 이후는 약 20만 개의 o200k_base 입니다. 어휘가 커지면 같은 문장이 더 적은 토큰으로 쪼개지므로, 모델을 바꾸면 프롬프트 길이 계산도 다시 해야 합니다.
GitHub — openai/tiktoken
관련 도구
- JSON 포매터 / 검증기
JSON 문자열을 포맷팅·검증·압축합니다. 들여쓰기 조정과 키 정렬 옵션이 있으며, 브라우저에서 즉시 실행됩니다.
- 문자열 케이스 변환
문자열을 camelCase·PascalCase·snake_case·kebab-case·CONSTANT_CASE·Title Case 6개 형태로 동시에 변환해 보여줍니다.
- 정규식 테스터
JavaScript 정규식을 실시간으로 테스트합니다. g/i/m/s/u/y 플래그와 캡처 그룹을 지원합니다.
- Markdown 프리뷰
Markdown을 HTML로 렌더링하여 좌·우로 비교 표시합니다. CommonMark + GFM(테이블·코드 펜스·태스크 리스트) 지원.
- HTML → Markdown
HTML을 Markdown으로 변환합니다. 헤딩·리스트·링크·코드·표·인용 지원. 브라우저 DOMParser 사용 — 정확하고 0 dependency.
- YAML ↔ JSON 변환
YAML과 JSON을 양방향 변환합니다. YAML 측의 주석·멀티라인 문자열을 허용합니다.
- 텍스트 비교
두 텍스트를 줄·단어·문자 단위로 비교하고 추가/삭제를 강조합니다.
- JSON 비교
두 JSON을 정렬·정규화 후 비교, 변경점을 강조합니다. 잘못된 JSON 에러 안내 포함.
- CSV ↔ JSON
CSV와 JSON을 상호 변환합니다. 쿼팅·구분자·헤더 행을 지원합니다.
- SQL 포매터
SQL 쿼리를 들여쓰기·키워드 케이스에 맞게 포매팅합니다. PostgreSQL/MySQL/SQLite/Standard 지원.
- XML 포매터
XML을 보기 좋게 포매팅하거나 압축합니다. SOAP·sitemap·설정 파일에 적합.
- XML ↔ JSON
XML과 JSON을 상호 변환합니다. 속성과 요소 표기를 모두 지원합니다.
- 스마트 붙여넣기
어떤 텍스트든 붙여넣으면 적합한 도구를 추천합니다 — JSON·JWT·Base64·URL·UUID·Cron 등 15종 자동 감지.
- 로렘 입숨 생성기
더미 텍스트를 단어·문장·문단 단위로 생성합니다. 정통 Lorem Ipsum 또는 랜덤.
- JSON Path 추출기
JSONPath 표현식($.store.book[*].author 등)으로 JSON에서 값을 추출합니다.
- JSON Schema 검증기
JSON 데이터를 JSON Schema(Draft 2020-12)로 검증합니다. Ajv + format 검증 지원.
- JSON Schema 생성기
샘플 JSON에서 JSON Schema(Draft 2020-12)를 자동 생성합니다. 타입·필수 필드·중첩 구조 추론.
- HTML 포매터
HTML을 보기 좋게 들여쓰기·압축합니다. pre/textarea 공백 보존.
- CSS 포매터
CSS를 들여쓰기·압축합니다. 셀렉터·속성 스타일 옵션.
- JavaScript 포매터
JavaScript를 들여쓰기·압축합니다. 들여쓰기 2/4/탭 옵션.
- TOML ↔ JSON
TOML과 JSON을 상호 변환합니다. Cargo.toml, pyproject.toml 등 설정 파일에 자주 사용.
- INI ↔ JSON
INI 설정 파일을 JSON으로 변환합니다. [section]·주석(;/#)·key=value 지원.
- JSON → TypeScript
JSON 샘플로 TypeScript interface를 생성합니다. 중첩 객체는 별도 interface로 분리.
- JS Object → JSON
JavaScript 객체 리터럴(따옴표 없는 키, 작은따옴표, trailing comma, 주석)을 표준 JSON 으로 변환합니다. 관대한 파서, 엄격한 출력.
- Slug 생성기
텍스트를 URL-safe slug으로 변환합니다. 구분자/대소문자/악센트 제거 옵션.
- ASCII 트리
들여쓰기 또는 경로 목록을 box-drawing 트리(├── │ └──)로 변환합니다.
- Diff 패치
두 텍스트로부터 unified diff(-u) 패치를 생성합니다. `git apply` / `patch -p0` 호환.
- Mock 데이터 생성기
이름·이메일·커스텀 필드·UUID·날짜 등 가짜 JSON 레코드와 SQL INSERT seed 데이터를 생성합니다. 외부 의존 없음.
- MongoDB Extended JSON
MongoDB Extended JSON(EJSON)을 Canonical ↔ Relaxed 양방향 변환하거나, BSON wrapper를 제거해 일반 JSON으로 만듭니다. 16종 wrapper 인식 ($oid/$date/$numberLong/$numberDecimal/$binary/…).
- Kubernetes YAML 시각화
Kubernetes 매니페스트를 붙여넣으면 리소스 그래프를 그립니다. Deployment·Service·Ingress·ConfigMap·Secret·PVC 의 연결을 한눈에. 모든 처리는 브라우저에서.
- Docker Compose 시각화
docker-compose.yml 을 붙여넣으면 서비스·네트워크·볼륨·depends_on 을 인터랙티브 그래프로 그립니다. 100% 브라우저 처리.
- PDF 텍스트 추출
PDF 파일에서 텍스트를 추출합니다. 페이지별 또는 전체 합쳐서. 마크다운 호환 출력, 브라우저에서만 처리.
- PPTX 텍스트 추출
PPTX 파일에서 슬라이드 텍스트를 추출합니다. 플레인 / 마크다운 / 슬라이드별 3 모드. 덱을 마크다운으로 옮길 때 유용 — 모두 브라우저에서.
- 정규식 다이어그램
정규식을 railroad 다이어그램으로 시각화. 분기·그룹·반복을 한눈에 — 브라우저에서.
- 글자수 세기
글자수(공백 포함/제외)·단어·문장·문단·줄·바이트 수를 실시간으로 세어줍니다. 자소서·리포트 분량 확인까지 브라우저에서 바로.