지금까지 이 블로그에서는 RTX 3060 12GB 위에
젬마4 12B, gpt-oss 20B, Qwen3.6 35B-A3B까지 계속 올려봤습니다.
그런데 계속 궁금한 게 하나 있었습니다. 이 카드로 로컬 이미지 생성도 되나?
찾아보니 로컬 이미지 생성도 12GB면 충분히 된다는 얘기가 많더군요.
그래서 이번엔 ComfyUI를 깔아봤습니다.
그리고 첫 이미지를 뽑다가 예상 못 한 걸 하나 발견했습니다! 바로 가시죠
로컬 이미지 생성 ComfyUI 설치
예전에는 파이썬 깔고 CUDA 맞추고 zip 풀고 하는 과정이 필요했는데
지금은 그냥 설치 파일 하나 받으면 끝입니다.
comfy.org에서 Comfy Desktop을 받아서 실행하면 됩니다.

Visual C++ 재배포 패키지를 먼저 확인하고, 없으면 알아서 깔아줍니다.
저는 이미 있어서 건너뛰더군요.
설치가 끝나면 첫 질문이 나옵니다. 클라우드로 돌릴까? 내 컴퓨터로 돌릴까?

당연히 Local입니다. (로컬 이미지 생성)
Cloud는 무료 5회를 주긴 하는데
그건 Comfy 쪽 서버 GPU로 도는 거라 제 3060 성능이랑 아무 상관이 없습니다.
이 글에서 그걸 쓸 이유가 없죠.
아래 Express Install은 체크하지 않았습니다.
켜면 경로를 안 물어보고 기본값에 그냥 박아버린다고 하네요
모델 파일이 수십 GB씩 쌓이는 걸 생각하면 경로는 직접 보는 게 낫습니다.

여기서 Detected GPU: NVIDIA가 뜨는지 꼭 확인하세요.
여기서 못 잡으면 CPU로 돌아가는데, 그러면 이미지 한 장에 몇 분씩 걸립니다.
다행히 3060은 바로 잡혔습니다.
경로는 기본값 그대로 뒀습니다. ~4.83GB required는 프로그램 본체 용량이고 모델은 여기 안 들어갑니다.
로컬 이미지 생성 첫 모델은 SDXL Turbo
다음 화면에서 시작할 모델을 고릅니다.

기본 추천은 Z-Image-Turbo인데 무려 크기가 19GB입니다.
디퓨전 모델 12GB에 텍스트 인코더 8GB가 붙는 구성이라 16GB 카드 기준으로 소개되는 모델입니다.
3060 12GB로는 무겁기도하고 다운로드만 한참일거같아 가벼운 모델로 갑니다.
Seedream 5.0 Pro는 REQUIRES CREDITS라고 붙어 있습니다.
로컬이 아니라 돈 내고 클라우드로 돌리는 겁니다. 제외.
그래서 세번째 모델, SDXL Turbo(약 6GB) 로 선택했습니다.
가장 가볍고, 관련 자료도 많다고 하더라구요?

다운로드 시작!
워크플로우 화면, 뭔가 복잡..?
설치가 끝나면 이런 화면이 뜹니다.

선이 잔뜩 얽혀 있어서 처음엔 당황스러운데, 그냥 왼쪽에서 오른쪽으로 흐른다고 보면 됩니다.
- 체크포인트 로드 모델 파일 불러오기
- CLIP 텍스트 인코딩 두 개 위가 긍정 프롬프트, 아래가 부정 프롬프트
- 빈 잠재 이미지 해상도 (512×512)
- 사용자 정의 샘플러 실제로 그림이 만들어지는 곳
- 이미지 저장 결과 표시
여기서 건드리면 안 되는 값이 있습니다. 스텝 수 1, cfg 1.0입니다.
SDXL Turbo 전용 설정이라 그렇습니다.
일반 SDXL 스텝 25, cfg 7 넣으면 오히려 이미지가 망가집니다.
해상도 512도 이 모델이 학습된 크기라 그대로 두는 게 좋습니다.
로컬 이미지 생성, 한국어 프롬프트를 넣어봤습니다
여기서부터가 이 글의 본론이죠.
이왕이면 한국적인 걸 뽑아보고 싶어서 진돗개로 정했습니다.
그리고 기왕이면 한국어로 넣어보고 싶었습니다. 요즘 모델들 한국어 잘하니까 되지 않을까 싶었거든요.

진돗개, 흰색 털, 눈 오는 마당에 앉아있는 모습, 사진
이렇게 넣고 실행 버튼 눌렀습니다. 결과는요.

개는 어디 갔죠? ㅋㅋ
안경 쓴 아저씨가 시장 골목에 서 있습니다. 진돗개랑 아무 관련이 없습니다.
게다가 좀 품질이.. 마음에 안드네요 아무튼
왜 프롬프트와 상관없는 이미지가 나오는가?
프롬프트는 CLIP이라는 텍스트 인코더를 거쳐서 모델에게 전달되는데, 이 인코더가 영어 위주로 학습돼 있습니다.
한글이 들어가면 의미를 못 읽고 알 수 없는 토큰 덩어리가 됩니다.
그러면 모델 입장에선 “조건이 거의 없음”에 가까운 상태가 되고, 학습 데이터의 평균값 같은 게 튀어나옵니다.
그런데 재밌는 게 하나 있습니다. 완전 무작위는 아니라는 겁니다.
동아시아인 얼굴에 좁은 골목 시장? 지하철?이 나왔거든요.
한글 토큰이 아주 약하게나마 아시아권 이미지 쪽으로 밀어붙인 흔적으로 보입니다.
영어로 바꾸니 제대로 나왔습니다
시드는 그대로 두고 프롬프트만 영어로 바꿨습니다.

a Korean Jindo dog, white fur, pointed ears, curled tail, sitting in a snowy yard, photorealistic, sharp focus

바로 나왔습니다.
같은 시드, 같은 모델, 같은 설정입니다. 프롬프트 언어만 바꿨는데 사람에서 개가 됐습니다.
이 정도면 더 설명이 필요 없죠.
품질도 꽤 좋습니다.
스텝 1로 뽑은 건데 털 질감이랑 눈 내리는 입자, 배경 흐림 처리까지 괜찮게 나왔습니다.
SDXL Turbo가 왜 아직도 쓰이는지 알겠더군요.
생성 시간은 대략 4초, VRAM 사용량은 7.8GB 정도 나왔습니다.
로컬 이미지 생성치곤 되게 빠르네요.
그런데 이게 진돗개가 맞나?
흰 털에 서 있는 귀, 전체 실루엣은 진돗개 백구 같긴 합니다.
그런데 얼굴이 좀 둥글고 목털이 과하고 몸이 통통합니다.
실제 진돗개는 좀 잽싸게 생겼는데.. 흠
그냥 “진돗개 나왔네” 하고 넘어갈 수도 있었는데, 확인해볼 방법이 하나 있었습니다.
시드를 고정한 채 견종 이름만 바꿔보는 겁니다.
Korean Jindo를 Japanese Akita로만 바꿔서 돌려봤습니다.

다른 점은 머리와 귀에 황갈색 반점이 생겼다는 겁니다.
아키타 이미지에서 흔히 보이는 색이긴 한데, 실제 견종 특징인지 그냥 시드 차이인지는 모르겠습니다.
진돗개 쪽은 순백이었고요.
배경도 벽돌 건물에서 목조 판자벽으로 바뀌었고, 눈발도 더 굵어졌습니다.
같은 점은 체형입니다.
둘 다 얼굴이 둥글고 목털이 풍성하고 몸이 두툼합니다.
두 장을 겹쳐보면 자세랑 실루엣이 거의 똑같습니다.
정리하면 이렇습니다.
모델은 색상만 구분하고 체형은 구분하지 못하는게 아닐까?
진돗개와 아키타를 별개 견종으로 알고 있는 게 아니라
“흰 스피츠 계열”이라는 하나의 틀에 마킹만 다르게 얹은 것 같은 느낌?
그래서 체형이 완전 다른 치와와도 프롬프트 입력해서 실행 시켜봤습니다.
a Chihuahua dog, white fur, sitting in a snowy yard, photorealistic, sharp focus

몸집이 작아진거같고 귀가 얼굴만 하게 커졌고, 입이 짧아지고 치와와 특징까지 제대로 잡았네요.
앞의 두 마리랑은 아예 다른 강아지입니다.
이 모델 강아지를 다 비슷한 체형으로 그리는 게 아니었습니다. 구분할 줄 아네요.
여러분 봤을때는 어떤가요?
정리하면
RTX 3060 12GB에서 로컬 이미지 생성, ComfyUI + SDXL Turbo 조합으로 잘 돌아갑니다.
설치도 엄청 쉽고요.
512×512 한 장에 약 4초, VRAM 7.8GB면 12GB 카드에서는 여유 있는 편입니다.
이번에 확인한 건 세 가지입니다.
- 로컬 이미지 생성, 한국어 프롬프트는 안 됩니다.
엉뚱한 게 나왔어요 영어로 쓰세요! - 12GB에서 SDXL Turbo는 여유롭습니다.
7.8GB만 쓰니까 4GB 넘게 남습니다. 첫 모델로 추천합니다.
그리고 이만큼 남았다는 건… 더 큰 것도 되지 않을까요? - 진돗개랑 아키타를 같은 체형으로 그립니다.
색만 다르고 몸은 똑같습니다.
그렇다고 개를 다 대충 그리는 건 아니에요. 치와와는 완전히 다르게 나왔거든요.
다음 글에서도 로컬 이미지 생성을 다루려고 합니다.
Z-Image-Turbo인데, 다운로드 용량이 무려 19GB입니다.
그런데 열어보니 디퓨전 모델 11.46GB, 텍스트 인코더 7.49GB, VAE 0.32GB로 나뉘어 있더군요.
셋이 동시에 올라가는 게 아니라 순서대로 쓰인다면?
그럼 진짜 관건은 11.46GB가 12GB에 들어가느냐가 되겠네요.
아슬아슬한데… 될까요?
이상 글 마치겠습니다!