SPEECH AI · STT · WHISPER · ENTERPRISE ARCHITECTURE 사람 목소리는 어떻게 글자가 될까? Whisper부터 2026년 STT까지 “Whisper를 로컬에 깔아봤는데 생각보다 별로였는데?”에서 출발해, STT의 기본 원리부터 모델의 변천사, 최신 Speech AI, GPU·API 비용, On-Premise와 금융권 Production까지 내려가 본다. 몇 년 전 개인 프로젝트로 Whisper를 로컬에 내려받아 STT를 돌려본 적이 있다면 아마 첫 느낌은 둘 중 하나였을 것이다.첫 30초“와, 진짜 글자로 나오네?”30분 뒤“근데 왜 상품명은 다 틀리지?” 조용한 방에서 한 사람이 또박또박 말하면 꽤 잘 된다. 그런데 회의실..