음성 파일에서 텍스트 추출 사용법
바로 사용하기 — 음성 파일에서 텍스트 추출 회의 녹음을 글로 옮겨야 하는데, 마땅한 방법이 없습니다. 온라인 서비스는 녹음 파일을 통째로 올리라고 합니다. 회의 내용이 밖으로 나가도 되는지부터 따져야 하죠. 인터뷰나 상담 녹음이라면 더 곤란합니다. 이 도구는 Whisper 모델을 브라우저 안에서 직접 돌립니다. 모델 파일만 한 번 내려받고 나면 계산은 전부 이 컴퓨터에서 일어납니다. 오디오는 페이지 밖으로 나가지 않아요. 서버 업로드도, API 키도, 회원가입도 없습니다. 사용법 오디오 파일 업로드: 파일 영역을 클릭하거나 드래그앤드롭. 지원 형식은 mp3·wav·m4a·ogg·webm·flac·aac·mp4 등 브라우저가 디코딩 가능한 것 전부. 언어 선택: 자동 감지 / 한국어 / 영어 / 일본어 / 중국어 / 스페인어 / 프랑스어 / 독일어. 대상 언어를 알면 명시 지정이 더 정확합니다. 모델 선택: base · small · medium 중 선택 (아래 표 참고). 타임스탬프 표시(옵션): 켜면 결과가 [00:00 → 00:05] 텍스트 형식으로 구간별로 나뉘어 출력됩니다. 텍스트 추출 시작 버튼 클릭. 오버레이가 뜨고 진행 상황이 표시됩니다. 완료 후 우상단 복사 또는 다운로드(.txt) 버튼 사용. 모델 비교 모델 다운로드 크기 정확도 처리 속도(60초 오디오 기준) 권장 상황 whisper-base 약 78 MB 보통 WebGPU ~4초 · WASM ~20초 일상적인 받아쓰기, 빠른 처리 whisper-small 약 244 MB 좋음 WebGPU ~11초 · WASM ~55초 한국어 포함 대부분의 실사용. 권장 whisper-medium 약 300 MB (q4) 매우 좋음 WebGPU ~35초 · WASM 실질 미지원 정확도 최우선, 장시간 대기 가능 모델은 한 번만 다운로드되고 브라우저 캐시에 저장되어 재방문 시 즉시 로드됩니다. 모델 변경 시에는 새 모델을 새로 다운로드/로드해야 합니다. 각 모델은 개별 캐싱되므로 이미 받은 모델은 재다운로드되지 않습니다. 실행 백엔드 (WebGPU / WASM) 옵션 패널 하단에 현재 백엔드가 표시됩니다. ...