바로 사용하기음성 파일에서 텍스트 추출

회의 녹음을 글로 옮겨야 하는데, 마땅한 방법이 없습니다.
온라인 서비스는 녹음 파일을 통째로 올리라고 합니다.
회의 내용이 밖으로 나가도 되는지부터 따져야 하죠. 인터뷰나 상담 녹음이라면 더 곤란합니다.

이 도구는 Whisper 모델을 브라우저 안에서 직접 돌립니다.
모델 파일만 한 번 내려받고 나면 계산은 전부 이 컴퓨터에서 일어납니다.
오디오는 페이지 밖으로 나가지 않아요. 서버 업로드도, API 키도, 회원가입도 없습니다.

사용법

  1. 오디오 파일 업로드: 파일 영역을 클릭하거나 드래그앤드롭. 지원 형식은 mp3·wav·m4a·ogg·webm·flac·aac·mp4 등 브라우저가 디코딩 가능한 것 전부.
  2. 언어 선택: 자동 감지 / 한국어 / 영어 / 일본어 / 중국어 / 스페인어 / 프랑스어 / 독일어. 대상 언어를 알면 명시 지정이 더 정확합니다.
  3. 모델 선택: base · small · medium 중 선택 (아래 표 참고).
  4. 타임스탬프 표시(옵션): 켜면 결과가 [00:00 → 00:05] 텍스트 형식으로 구간별로 나뉘어 출력됩니다.
  5. 텍스트 추출 시작 버튼 클릭. 오버레이가 뜨고 진행 상황이 표시됩니다.
  6. 완료 후 우상단 복사 또는 다운로드(.txt) 버튼 사용.

모델 비교

모델다운로드 크기정확도처리 속도(60초 오디오 기준)권장 상황
whisper-base약 78 MB보통WebGPU ~4초 · WASM ~20초일상적인 받아쓰기, 빠른 처리
whisper-small약 244 MB좋음WebGPU ~11초 · WASM ~55초한국어 포함 대부분의 실사용. 권장
whisper-medium약 300 MB (q4)매우 좋음WebGPU ~35초 · WASM 실질 미지원정확도 최우선, 장시간 대기 가능
  • 모델은 한 번만 다운로드되고 브라우저 캐시에 저장되어 재방문 시 즉시 로드됩니다.
  • 모델 변경 시에는 새 모델을 새로 다운로드/로드해야 합니다. 각 모델은 개별 캐싱되므로 이미 받은 모델은 재다운로드되지 않습니다.

실행 백엔드 (WebGPU / WASM)

옵션 패널 하단에 현재 백엔드가 표시됩니다.

  • WebGPU 가속 사용 가능 (초록 번개): 최신 크롬·엣지·사파리 등에서 GPU로 실행 → 빠름.
  • WASM 모드로 실행됩니다 (모래시계): WebGPU 미지원 브라우저·오래된 하드웨어. 동작은 하지만 5~10배 느림.

참고: whisper-medium은 저장소의 q4 양자화 파일을 사용해 브라우저 메모리 안에서 실행됩니다. WebGPU가 없는 환경에서는 사실상 사용이 어렵습니다.

진행 상황 오버레이

전 처리 과정에서 화면 중앙에 반투명 카드가 뜹니다.

  • 오디오 디코딩: 파일을 16kHz 모노로 리샘플링. 대개 1~3초.
  • 모델 준비: 인코더 / 디코더 / 토크나이저 등 파일별로 나눠 % 표시. 최초 실행에서만 다운로드 진행률이 보이고, 캐시된 다음번엔 순식간에 끝납니다.
  • 텍스트 추출 중: 오디오 길이와 모델을 기준으로 “남은 시간 약 N분"을 대략 계산해 10초에 한 번 갱신. RTF(real-time factor) 기반 추정이므로 오차 ±50% 수준.

카드 우상단 X 버튼으로 언제든 취소할 수 있습니다. 취소해도 이미 다운로드된 모델 파일은 캐시에 남아 다음번 실행 시 재사용됩니다.

품질과 안전장치

결과 안전장치 (자동 저장)

완료된 추출 결과는 브라우저 로컬 스토리지에 자동 저장됩니다. 실수로 새로고침하거나 탭을 닫아도 페이지를 다시 열면 이전 결과가 복원되고 “이전 추출 결과를 불러왔습니다 (…저장)” 안내가 뜹니다. 새로운 추출을 완료하면 이전 결과는 덮어씌워집니다(최근 1건만 보관).

반복 루프 방지

Whisper에는 고질병이 하나 있습니다.
무음이나 잡음 구간을 만나면 같은 단어를 수십 번 되풀이해 뱉는 현상이죠.
“감사합니다 감사합니다 감사합니다…” 가 화면을 채우는 걸 보신 적 있을 겁니다. 본 도구는 no_repeat_ngram_size=3과 그리디 디코딩(temperature=0)을 강제해 3-gram 이상의 연속 반복을 원천 차단합니다.

지원 오디오 형식

브라우저의 AudioContext가 디코딩할 수 있는 형식은 모두 지원됩니다.

  • 일반적으로 통용: mp3, wav, m4a, ogg, opus, webm, flac, aac
  • 컨테이너: mp4의 오디오 트랙도 추출됩니다
  • 스테레오/다채널은 자동으로 모노로 다운믹싱됩니다
  • 원본 샘플레이트와 무관하게 16kHz로 자동 리샘플링됩니다

알아두기

프라이버시

  • 완전 클라이언트 사이드: 오디오·중간 결과·최종 텍스트가 어떤 서버로도 전송되지 않습니다.
  • 모델 파일은 최초 로드시에만 Hugging Face CDN에서 받아 브라우저 캐시(Cache Storage)에 저장됩니다.
  • 결과 저장소는 브라우저 localStorage뿐이며 사이트 도메인 안에서만 접근 가능합니다.

주의사항

  • 첫 실행 시 모델 다운로드로 시간이 걸립니다 (base 약 80MB, medium 약 300MB). 인터넷 속도에 따라 수십 초~수 분.
  • 긴 오디오는 시간이 걸립니다. 30분 강의를 medium으로 돌리면 실측 15분 내외.
  • 모바일 브라우저는 메모리 한계로 small 이상은 실패할 가능성이 있습니다. 모바일에서는 base 권장.
  • 자동 감지는 짧은 오디오(<5초)에서 오판할 수 있습니다. 대상 언어를 알면 지정하세요.
  • 모든 처리가 클라이언트에서 이루어지므로 동일 오디오라도 기기 성능에 따라 처리 시간이 크게 달라집니다.

다국어

페이지 전체가 한국어/영어를 지원하며 좌상단 KO/EN 토글로 즉시 전환됩니다.

바로 사용하기음성 파일에서 텍스트 추출