용어집
용어, 쉽게 정리했어요
생성형 미디어는 사진, 영화, 머신러닝에서 용어를 빌려 오고 나머지는 새로 만들었어요. 용어 44개를 각각 두 문장으로 정의하고, 스튜디오에서 어떻게 작동하는지도 함께 담았어요.
동영상
텍스트 투 비디오(Text-to-Video)
텍스트 투 비디오는 글로 쓴 프롬프트만으로 동영상 클립을 생성하는 방식이에요. 모델이 설명을 바탕으로 피사체, 움직임, 카메라, 조명을 합성하며, 보통 몇 초 길이의 클립을 만들어요.
이미지 투 비디오(Image-to-Video)
이미지 투 비디오는 정지 이미지를 움직여 동영상 클립으로 만드는 방식이에요. 이미지가 피사체와 구도를 고정하고, 프롬프트는 움직임을 설명해요. 생성 영상에서 특정 얼굴이나 제품을 일관되게 유지하는 표준적인 방법이에요.
카메라 무빙
카메라 무빙은 클립이 진행되는 동안 가상 카메라가 움직이는 방식이에요. 팬, 푸시 인, 트래킹, 오빗, 크레인, 돌리 줌 등이 있어요. AI 영상에서는 장비를 설치하는 대신 프롬프트로 지시하며, 피사체보다도 샷의 느낌을 더 크게 좌우해요.
돌리 줌
돌리 줌은 카메라가 피사체 쪽으로 다가가거나 멀어지면서 반대 방향으로 줌을 해서, 피사체 크기는 그대로인데 배경만 늘어나거나 압축되는 기법이에요. 히치콕과 「죠스」로 유명해진 ‘버티고 효과’예요.
화면비(Aspect Ratio)
화면비(화면 비율)는 프레임의 가로세로 비율이에요. 와이드스크린과 유튜브는 16:9, 세로형 숏폼은 9:16, 정사각형 피드는 1:1, 시네마는 21:9를 써요. AI 생성에서는 최신 엔진에서는 파라미터로, 구형 엔진에서는 프롬프트 힌트로 지정해요.
스토리보드
스토리보드는 영화를 샷 단위로 계획한 것으로, 각 씬의 구도, 동작, 길이를 순서대로 정리해요. AI 영상에서는 클립 길이 제한을 넘어서는 방법이기도 해요. 같은 룩의 여러 클립을 하나의 편집본으로 이어서 재생하는 거죠.
테이크
테이크는 한 씬을 한 번 렌더링한 결과물이에요. 같은 프롬프트로 테이크를 여러 개 렌더링해 가장 좋은 것을 고르는 것이, 생성 영상을 그냥 받아들이지 않고 연출하는 방법이에요.
첫/마지막 프레임
첫/마지막 프레임 생성은 동영상 엔진에 시작 이미지와 마지막 이미지를 모두 주고, 모델이 그 사이의 움직임을 보간하게 하는 방식이에요. 클립이 어디서 끝날지 가장 정밀하게 제어하는 방법이에요.
템포
템포는 클립 안에서 움직임이 전개되는 속도감으로, 잔잔하거나 몽환적이거나 역동적이거나 긴장감 있거나 혼란스러울 수 있어요. 피사체와 카메라가 얼마나 빨리 움직이는지, 샷에 얼마나 많은 에너지가 실리는지를 좌우해요.
아나모픽 렌즈
아나모픽 렌즈는 넓은 화면을 압축해 센서에 담고 후반 작업에서 다시 펼치는 렌즈로, 타원형 보케, 가로로 길게 퍼지는 렌즈 플레어, 은은한 와이드스크린 느낌이라는 시네마틱한 특징을 만들어요.
업스케일링
업스케일링은 생성이 끝난 이미지나 클립을 나중에 확대하는 작업으로, 늘어난 픽셀은 별도의 모델이 만들어 내요. 다시 생성하지 않고 720p 렌더를 1080p나 4K 결과물로 만드는 방법이에요.
립싱크
립싱크는 제공한 오디오 트랙에 맞춰 입 모양이 움직이도록 얼굴을 애니메이션하는 기술이에요. 정지된 인물 사진이나 무음 클립을 내 대사를 말하는 사람처럼 보이게 만들어요.
B롤(B-roll)
B롤은 내레이션 위나 메인 샷 사이에 들어가는 보조 영상이에요. 손, 디테일, 거리 풍경, 테이블 위의 제품 같은 것들이죠. 목소리가 이야기를 끌고 가는 동안 편집의 흐름을 받쳐 줘요.
설정 샷(Establishing Shot)
설정 샷은 장면이 시작되기 전에 관객에게 지금 어디에 있는지 알려 주는 와이드 프레임이에요. 보통 시퀀스의 첫 번째 샷이고, 장소 전체를 보여 주는 유일한 샷인 경우가 많아요.
키프레임
키프레임은 생성되는 대신 내용이 고정되어 있고, 움직임이 그것을 중심으로 만들어지는 프레임이에요. AI 영상에서는 첫 프레임과, 지원되는 경우 마지막 프레임이 키프레임이에요.
이미지
레퍼런스 이미지
레퍼런스 이미지는 프롬프트와 함께 제공하는 이미지로, 모델이 그 안의 얼굴, 제품, 스타일 같은 요소를 새 렌더에서도 유지하게 해 줘요. AI 이미지와 영상에서 캐릭터 일관성의 기본이 돼요.
필름 그레인
필름 그레인은 화학 필름 특유의 미세하고 불규칙한 입자 질감으로, 디지털 렌더에 더해 아날로그로 촬영한 느낌을 주고 합성 이미지의 지나치게 깨끗한 느낌을 감춰요.
이미지 투 이미지(Image-to-Image)
이미지 투 이미지는 프롬프트를 바탕으로 기존 이미지를 편집하거나 스타일을 바꾸는 방식으로, 구도는 유지하면서 디테일, 스타일, 피사체를 바꿔요. 레퍼런스 기반 생성이 가장 흔한 창작 활용법이에요.
역광(Contre-jour)
역광(콩트르주르)은 광원이 피사체 뒤에 놓이는 조명으로, 윤곽을 감싸는 림 라이트 후광, 실루엣, 렌즈 글로우를 만들어요. 골든아워의 대표적인 룩이에요.
인페인팅
인페인팅은 이미지에서 선택한 영역만 다시 생성하고 나머지는 그대로 두는 기술이에요. 손을 마스킹해 다시 그리거나, 사물을 지우거나, 디테일 하나를 바꾸는 식이죠. 마스크 자체가 지시가 돼요.
보이스
음성 복제(보이스 클로닝)
음성 복제는 녹음을 바탕으로 합성 음성을 만들어, 새로운 텍스트를 그 목소리로 읽게 하는 기술이에요. 최신 엔진은 깨끗한 음성 1분 정도면 충분하고, 언어가 바뀌어도 음색과 말투를 재현해요.
텍스트 음성 변환(TTS)
텍스트 음성 변환(TTS)은 글로 쓴 텍스트를 음성 오디오로 바꾸는 기술이에요. 표현력이 풍부한 TTS 엔진은 문장 부호를 연기 지시로 읽고 속도, 표현력 같은 설정을 제공해, 자연스러운 내레이션과 대사를 만들어요.
음성 텍스트 변환(STT)
음성 텍스트 변환(STT)은 말소리 오디오를 글로 받아 적는 기술이에요. 채팅 모델, TTS와 함께 쓰면 음성 대화 루프가 완성돼요.
보이스오버(내레이션)
보이스오버는 카메라 앞에서 말하는 대신 영상 위에 입히는 내레이션이에요. 설명 영상, 광고, 다큐멘터리에서 영상이 내용을 보여 주는 동안 이야기를 끌고 가요.
화자 분리(Diarization)
화자 분리는 음성 인식에서 누가 언제 말했는지 파악해, 받아 적은 텍스트에 화자별로 표시하는 기능이에요. 인터뷰를 받아 적은 텍스트 덩어리를 읽기 쉬운 대화록으로 바꿔 주는 게 바로 이 기능이에요.
프롬프트 작성
네거티브 프롬프트
네거티브 프롬프트는 텍스트, 워터마크, 여분의 손가락, 흐림처럼 모델이 피해야 할 요소를 나열한 것이에요. 메인 프롬프트가 그런 요소가 없다는 걸 알아서 암시해 주길 바라는 대신, 생성 결과를 그 요소들에서 멀어지도록 유도해요.
CFG 스케일
CFG 스케일(classifier-free guidance)은 디퓨전 모델이 프롬프트를 얼마나 엄격하게 따를지 정하는 값이에요. 값이 낮으면 더 자유롭고 다양한 이미지가 나오고, 높으면 자연스러움을 희생하는 대신 문구를 글자 그대로 따라요.
시드
시드는 생성 과정의 무작위성을 초기화하는 숫자예요. 프롬프트, 설정, 시드가 같으면 같은 결과가 재현되므로, 다시 렌더링하는 일이 운에 맡기는 도박이 아니라 수정 작업이 돼요.
프롬프트 개선 도구
프롬프트 개선 도구는 대략적인 아이디어를 생성 엔진이 잘 반응하는 구조(피사체, 움직임, 카메라, 빛, 분위기)의 프롬프트로 다시 써 주거나, 아예 처음부터 프롬프트를 만들어 줘요.
연출 패널
연출 패널은 eroq의 룩 설정 모음이에요. 필름 종류, 시대, 템포, 카메라 장비, 렌즈, 조리개, 팔레트, 조명을 서버에서 모든 프롬프트에 반영해, 영화 한 편 전체가 하나의 미감을 공유하게 해요.
피사계 심도(Depth of Field)
피사계 심도는 화면의 앞쪽부터 뒤쪽까지 초점이 맞는 범위를 말해요. 심도가 얕으면 흐릿한 배경 앞에서 피사체가 도드라지고, 깊으면 장면 전체가 선명하게 유지돼요.
컬러 팔레트
컬러 팔레트는 작품의 색 보정이 향하는 한정된 색조의 조합이에요. 네온 누아르, 따뜻한 필름, 블리치 바이패스 같은 것들이죠. 팔레트를 하나로 정해야 따로 만든 샷들이 한 작품처럼 보여요.
플랫폼
무검열 AI
무검열 AI는 프롬프트가 요청한 것을 거절하지 않고 렌더링하는 모델을 말해요. 어둡거나 폭력적이거나 도발적인 픽션도 포함되며, 확률적인 콘텐츠 필터가 아니라 명문화된 이용 정책으로 관리돼요. ‘규칙이 없다’는 뜻이었던 적은 한 번도 없어요.
크레딧
크레딧은 AI 생성을 위한 선불 단위예요. 호출마다 토큰 요금 대신 공개된 크레딧 수가 차감되므로 예산을 예측하기 쉬워요. eroq에서는 입문 팩 기준 1 크레딧이 약 1센트예요.
MCP(모델 컨텍스트 프로토콜)
MCP는 AI 어시스턴트가 외부 도구를 호출할 수 있게 해 주는 개방형 프로토콜이에요. MCP 서버는 동영상 생성 같은 기능을 제공하고, ChatGPT, Claude, 코딩 에이전트가 대화 중에 이를 호출할 수 있어요.
SSE 스트리밍
SSE(server-sent events)는 하나의 HTTP 연결로 채팅 응답을 토큰 단위로 스트리밍해서, 사용자가 응답 전체를 기다리지 않고 생성되는 대로 텍스트를 볼 수 있게 해요.
엘리먼트
eroq에서 엘리먼트는 한 번 저장해 두고 프롬프트에서 @멘션해 재사용하는 장소, 사물, 스타일이에요. 덕분에 같은 장소, 제품, 룩이 여러 렌더와 팀 전체에 걸쳐 똑같이 등장해요.
일관된 캐릭터
일관된 캐릭터는 얼굴 레퍼런스, 페르소나, 목소리를 한 번 정의해 두고 이미지, 동영상, 대화에서 계속 재사용하는 AI 캐스트 멤버예요. 그래서 모든 장면에서 같은 인물로 유지돼요.
리믹스
리믹스는 완성된 렌더의 전체 레시피(프롬프트, 모델, 카메라, 연출 패널 설정, 길이)를 입력창에 다시 불러와서, 기억을 더듬어 처음부터 다시 만드는 대신 바로 수정할 수 있게 해 줘요.
웹훅
웹훅은 비동기 작업이 끝났을 때 플랫폼이 내 서버로 보내는 서명된 HTTP 콜백이에요. 덕분에 폴링할 필요가 없어요. 몇 분씩 걸리는 동영상 생성이 대표적인 사례예요.
워크스페이스
워크스페이스는 멤버, 시트, 하나의 크레딧 지갑을 갖춘 공유 계정 공간이에요. 각자 자기 로그인을 유지하면서 팀이 함께 크레딧을 쓰고 작업할 수 있어요.
워터마크
워터마크는 생성된 미디어에 박혀 있는 눈에 보이는 표시로, 보통 모서리에 로고 형태로 들어가 어떤 도구로 만들었는지 알려 줘요. 많은 생성기가 무료나 하위 요금제에서는 워터마크를 넣고, 상위 요금제에서는 빼 줘요.
요청 한도(Rate Limit)
요청 한도는 계정이 분당 보낼 수 있는 요청 수의 상한이에요. 공유 처리 용량을 보호하며, 같은 호출이라도 한꺼번에 병렬로 보내면 실패하고 시간차를 두고 보내면 성공하는 이유가 바로 이것이에요.
API 키
API 키는 프로그램이 API에 인증할 때 쓰는 비밀 문자열로, 모든 요청에 bearer 토큰으로 함께 보내요. 호출 비용을 내는 계정을 식별하는 역할을 해요.