클로드(Claude)는 텍스트 AI라서 스스로 그림을 그리지 못한다. 하지만 로컬 PC에서 돌아가는 이미지 생성 서버를 붙여주면, “고양이 그려줘” 한마디로 클로드가 프롬프트를 다듬어 그림을 만들어내게 할 수 있다. 오늘은 게이밍 노트북(RTX 4060)에 ComfyUI + SDXL을 설치해서 이걸 실제로 구축한 과정을 정리한다. 비용은 0원, 인터넷 없이도 동작한다.
어떤 도구로 그리게 할까 — 선택지 3개
- Automatic1111 WebUI (로컬) — 전통적인 웹 UI라 직접 만지기엔 가장 쉽지만, 메모리 관리가 헐거워 VRAM 8GB에서 SDXL이 버겁다.
- 나노바나나 (클라우드, Gemini API) — 설치 없이 API 키만 있으면 되고 품질도 좋지만, 장당 약 50원 + 인터넷 필수 + 워터마크가 박힌다.
- ComfyUI (로컬) ← 최종 선택 — 노드 UI가 낯설지만 어차피 클로드가 API로 호출하니 상관없다. 세 후보 중 VRAM 효율이 가장 좋고(8GB 노트북에 결정적), 워크플로 전체가 JSON이라 프로그램이 호출하기 가장 깔끔하며, 무료·무제한·오프라인이다.
전체 구조
핵심 아이디어는 간단하다. 클로드는 “지휘"만 하고, 그림은 로컬 GPU가 그린다.
| |
- ComfyUI: Stable Diffusion을 돌리는 오픈소스 프로그램. REST API를 제공해서 외부 프로그램(클로드)이 호출할 수 있다.
- SDXL: Stability AI의 이미지 생성 모델. 1024×1024 네이티브 해상도.
내 PC로 가능할까? — 사양 확인
설치 전에 확인한 최소 조건과 내 노트북(HP Victus 16) 사양:
| 항목 | 필요 사양 | 내 노트북 | 판정 |
|---|---|---|---|
| GPU VRAM | 8GB 이상 권장 (SDXL) | RTX 4060 Laptop 8GB | 통과 |
| RAM | 16GB | 16GB | 통과 |
| 디스크 | 약 20GB | 351GB 여유 | 통과 |
VRAM 8GB가 SDXL의 사실상 마지노선이다. 6GB 이하면 더 가벼운 SD 1.5 모델을 쓰는 게 낫다.
설치 과정 (Windows 11 기준)
1. ComfyUI 클론 + 가상환경
| |
2. PyTorch (CUDA 버전) 설치
일반 pip install torch는 CPU 버전이 설치되므로, 반드시 CUDA 인덱스를 지정해야 GPU를 쓴다.
| |
설치 후 GPU 인식 확인:
| |
3. 의존성 + SDXL 모델 다운로드
| |
4. 서버 실행
| |
브라우저에서 http://127.0.0.1:8188을 열면 노드 기반 UI가 뜨지만, 클로드 연동이 목적이라면 UI를 직접 만질 일은 거의 없다.
클로드와 연결하기
ComfyUI의 API는 두 개 엔드포인트가 핵심이다.
POST /prompt— 워크플로(JSON)를 제출하면prompt_id를 돌려준다GET /history/{prompt_id}— 생성이 끝나면 결과 이미지 파일명이 담겨 온다
이걸 호출하는 파이썬 스크립트(generate.py)를 하나 만들고, 클로드 코드(Claude Code)에는 스킬(skill) 하나를 등록했다. 스킬은 “이런 요청이 오면 이 스크립트를 실행해라"라는 지침서다:
| |
이제 클로드에게 “~그려줘"라고 하면: ① 서버가 꺼져 있으면 자동 기동 → ② 한국어를 영어 프롬프트로 번역·보강 → ③ 생성 → ④ 채팅에 그림 표시까지 알아서 한다.
결과물 — 프롬프트 예시 3개
실제로 이 노트북에서 생성한 이미지들이다. 프롬프트를 어떻게 쓰느냐가 품질의 절반이다.
예시 1 — 인물/동물 + 조명 지정
| |

예시 2 — 풍경 + 분위기 키워드
| |

예시 3 — 실존 장소 + 시간대 + 스타일
| |

프롬프트 팁: ① 영어로 쓸 것(SDXL은 영어 학습 비중이 압도적) ② photorealistic, cinematic lighting 같은 스타일 키워드를 뒤에 붙일 것 ③ 피하고 싶은 요소는 네거티브 프롬프트(blurry, low quality, watermark...)로 분리할 것.
실측 성능 (RTX 4060 Laptop, 8GB)
- 첫 생성: 약 1분 (서버 기동 + 모델 VRAM 로딩 포함)
- 이후: 장당 20~40초 (1024×1024, 28스텝)
- 스텝을 20으로 줄이면 ~24초, 품질 차이는 크지 않음
정리
- 8GB VRAM 노트북이면 SDXL 로컬 생성이 충분히 실용적이다.
- 클로드 연동의 핵심은 “ComfyUI API를 부르는 스크립트 + 스킬 등록” 두 가지뿐.
- 클라우드 API(나노바나나 등) 대비 장점: 무료·무제한·오프라인. 단점: 품질과 텍스트 렌더링은 클라우드 모델이 우세.
- 다음 단계: 나노바나나(Gemini 이미지 API) 연동을 추가해서 로컬/클라우드를 골라 쓰는 것도 고려 중.