블로그/guides·2026년 8월 20일·3분·eroq 팀 작성
무검열 모델 셀프 호스팅 vs 무검열 AI API: 진짜 계산
GPU 임대료, 가동률 곡선, 운영 시간까지. 무검열 스택을 직접 운영할 때와 호출당 고정 크레딧의 손익분기점을 솔직하게 분석했어요.
‘4090을 빌리면 한 달에 $300인데 왜 호출마다 돈을 내?’ 무검열 AI API에 대한 가장 합리적인 반론이고, 때로는 맞는 말이에요. 트윗 한 줄에 담기지 않는 부분까지 포함해서 실제로 계산해 볼게요.
표면적인 계산
소비자용 GPU(4090급)를 빌리면 시간당 대략 $0.35–0.50, 상시 가동하면 월 $250–370 정도예요. 더 큰 모델용 A100급 카드는 시간당 $1.10–1.80, 즉 월 $800–1,300이에요. 4090에서 양자화한 13B 롤플레이 모델이면 실제 서비스의 채팅 트래픽을 감당할 수 있고, 70B라면 A100이나 멀티 GPU 장비가 필요해요.
고정 크레딧과 비교하면(응답 하나에 1–3 크레딧 ≈ 1–3¢, 전체 요금표), 채팅 기준 단순 손익분기점은 이래요.
| 월간 응답 수 | API 비용(RP mini) | 셀프 호스팅(4090) |
|---|---|---|
| 100,000 | ~$830 | ~$300 + 운영비 |
| 30,000 | ~$250 | ~$300 + 운영비 |
| 10,000 | ~$83 | ~$300 + 운영비 |
대략 월 3만~4만 건쯤에서 GPU 쪽 선이 API 쪽 선 아래로 내려가요. 규모가 크면 셀프 호스팅으로 결론일까요? 다음 네 가지가 여러분에게 해당되지 않을 때만요.
표면적인 계산이 숨기는 것
가동률이 전부예요. GPU는 24시간 내내 과금되는데, 사용자는 저녁 피크 시간에 몰려와요. 실제 서비스의 가동률은 15–35%이고, 그러면 실질적인 호출당 비용이 두세 배로 뛰어요. API의 고정 가격이 바로 다른 누군가가 대신 해 주는 배칭이에요. 놀고 있는 실리콘이 아니라 결과물에 돈을 내는 거죠. 실패한 생성은 자동으로 환불되기까지 해요.
운영은 각주가 아니라 인건비예요. 모델 업데이트, CUDA 드라이버 룰렛, 토요일 피크에 터지는 OOM 크래시, 파인튜닝을 업데이트할 때마다 생기는 양자화 품질 저하. 프로덕션 추론 스택이라면 매달 실제 엔지니어링 시간을 예산에 넣어야 해요. 외주 단가로 치면 토큰 하나 서빙하기 전에 이미 API 요금만큼 나가요.
튜닝은 보이지 않는 비용이에요. 손대지 않은 무검열 체크포인트는 롤플레이 부하가 걸리면 같은 말을 반복하고, 캐릭터에서 벗어나고, 제4의 벽을 깨요. 실패 유형은 구체적이고, 그걸 고치는 일(샘플링 프로필, 반복 억제, 말투 제어)이 바로 여러분이 건너뛰고 싶었던 작업이에요.
채팅은 쉬운 모달리티였어요. 서비스에 이미지, 동영상, 보이스, 음성 인식이 필요해지는 순간 셀프 호스팅은 몇 배로 불어나요. 모델도, VRAM도, 파이프라인도 따로따로예요. 거기에 결과물을 위한 스토리지와 CDN까지요. 열 가지를 모두 커버하는 API 키 하나. 작은 팀이라면 보통 이 논리에서 논쟁이 끝나요.
셀프 호스팅이 진짜로 이기는 경우
솔직하게 말하면, 다음 네 가지가 모두 해당될 때 셀프 호스팅이 맞는 선택이에요.
- 꾸준하고 많고 예측 가능한 물량(저녁 시간대 급등락 없이 월 응답 5만 건 이상)
- 하나의 모달리티, 이미 검증한 하나의 모델
- 추론을 직접 맡고 싶어 하는 엔지니어(데이터 위치나 컴플라이언스 요건이 있다면 두 배로 중요해요)
- 무언가를 다시 컴파일하는 동안 주말 내내 이어지는 다운타임을 견딜 여유
실제로 있는 유형이에요. 이 분야 최고의 서비스 중 일부도 이렇게 운영돼요. 다만 대부분의 서비스는 아니고, 반복 속도가 마진보다 값진 초기 단계의 서비스는 거의 절대 아니에요.
자체 GPU로 마음이 기우는 이유가 개인정보라면, GPU 견적보다 제공사의 데이터 보관 약관을 먼저 읽어 보세요. 여기서는 RP+와 RP mini를 포함한 eroq 자체 모델이 업스트림에 아무것도 남기지 않아요. 그리고 프라이빗 모드(스튜디오 토글, 또는 이미지·동영상 엔드포인트의 private: true)를 쓰면 파일도 라이브러리 항목도 남지 않고, 사용 내역의 프롬프트는 별표로 바뀌어요. 프라이빗 모드가 아니면 프롬프트는 결제와 악용 대응을 위해 사용 내역에 보관돼요. 컴플라이언스 요건상 그것조차 안 된다면 위의 3번 조건에 해당하니, 셀프 호스팅이 정직한 답이에요.
실제로 통하는 하이브리드
성공하는 패턴은 이래요. API로 프로토타입을 만들고 출시하세요(키 하나, 무료 크레딧 50, 5분짜리 퀵스타트). 실제 트래픽을 계측하고, 진짜 물량에서 계산을 다시 해 보세요. 가격이 고정이고 공개돼 있어서 스프레드시트의 API 쪽은 5분이면 채워요. 채팅 물량만으로 선을 넘는다면 그 워크로드만 자체 GPU로 옮기고, 이미지, 동영상, 보이스는 API에 남겨 두세요. API가 상태를 저장하지 않아서 전환은 지루할 만큼 간단해요. 워크로드마다 base URL 하나만 바꾸면 돼요.
자주 묻는 질문
무검열 모델을 셀프 호스팅하는 게 API보다 저렴한가요?
물량이 많고 채팅만 놓고 보면, 결국에는 그래요. 1 크레딧짜리 RP mini 호출과 비교하면 단순 교차점은 월 3만~4만 건 근처예요. 여기에 보정을 적용하세요. 실제 가동률 15–35%는 실질 호출당 비용을 두세 배로 올리고, 운영 시간은 인건비 항목이에요. 이 두 가지를 정직하게 반영해 보면, 교차점은 보통 표면적인 계산보다 훨씬 멀리 있어요.
무검열 롤플레이 모델을 돌리려면 어떤 GPU가 필요한가요?
4090급 카드에서 양자화한 13B 모델이면 상시 가동 기준 월 약 $250–370로 실제 서비스의 채팅 트래픽을 감당해요. 70B라면 A100급 카드나 멀티 GPU 장비가 필요하고, $800–1,300 범위예요. 2026년 9월 기준 임대 가격이니, 스프레드시트를 짜기 전에 현재 시세를 확인하세요.
월 100,000건이면 eroq 비용은 얼마인가요?
RP mini 기준 100,000 크레딧이에요. $100에 12,000 크레딧인 팩 단가로 약 $833, 입문 팩 기준으로는 약 $1,000예요. 플랜 크레딧은 영원히 이월되니, 어느 달에 구독량이 남아도 버려지지 않고 쌓여요.
둘 다 운영하다가 나중에 워크로드를 옮길 수 있나요?
네, 보통 그게 통하는 패턴이에요. API로 프로토타입을 만들고, 실제 트래픽을 계측한 다음, 선을 넘는 워크로드(거의 항상 채팅)만 자체 GPU로 옮기고 이미지, 동영상, 보이스, 음성 인식은 키 하나에 남겨 두세요. API가 상태를 저장하지 않아서, 전환은 마이그레이션이 아니라 워크로드마다 base URL 하나를 바꾸는 일이에요.
인프라 결정에는 느낌이 아니라 영수증이 필요해요. 두 열 모두 여러분의 숫자로 계산해 보세요.
이 글에 나온 모델로 직접 만들어 보세요 — 무료 크레딧 50개로 시작하거나, 모든 엔진과 가격도 살펴보세요.