Toonkit으로 나만의 Style LoRA 만들기
20장의 이미지로 더 좋은 스타일을 학습하는 데이터 구성과 파라미터 설정 가이드

안녕하세요. Toonkit 개발팀입니다.
오늘은 Toonkit에서 제공하는 My Style LoRA 학습하기 기능을 더욱 효과적으로 활용하는 방법을 소개해 드리려고 합니다.
좋은 Style LoRA를 만들기 위해서는 단순히 이미지를 많이 준비하거나 학습 시간을 늘리는 것보다, 어떤 이미지로 데이터셋을 구성하는지, 그리고 학습 파라미터를 어떻게 설정하는지가 중요합니다.
이번 글에서는 Style LoRA 학습을 처음 접하는 분들도 쉽게 이해할 수 있도록 데이터셋 구성 방법부터 주요 학습 파라미터의 의미, 더 좋은 결과를 얻기 위한 기본적인 설정 방법까지 차근차근 설명해 보겠습니다.
물론 스타일과 데이터의 특성에 따라 최적의 설정은 달라질 수 있습니다. 아래에서 소개하는 내용은 모든 상황에 적용되는 절대적인 정답이라기보다, Style LoRA 학습을 시작할 때 참고할 수 있는 기본 가이드로 활용해 주세요.
그럼 지금부터 Style LoRA의 성능을 높이기 위한 데이터셋 구성 방법과 학습 파라미터 설정 방법을 함께 알아보겠습니다.
1. Style LoRA는 쉽게 말해 무엇인가요?
LoRA는 기본 이미지 생성 모델에게 새로운 특징을 추가로 익히게 하는 기술입니다.
비유하자면, 기본 이미지 생성 모델이 이미 그림을 그릴 줄 아는 사람이라면 LoRA는 그 사람에게 새로운 화풍이나 표현 방식을 알려주는 작은 스타일 가이드와 같습니다.
LoRA는 기존 모델 전체를 다시 학습하지 않고, 새로운 특징을 익히는 데 필요한 일부만 학습합니다. 따라서 모델 전체를 학습하는 방식보다 필요한 시간과 GPU 메모리를 줄일 수 있습니다.
Style LoRA는 특정 캐릭터 한 명이나 특정 사물을 기억시키는 것이 아니라, 이미지들이 공통으로 가지고 있는 시각적 스타일을 학습하는 LoRA입니다.
여기서 스타일에는 다음과 같은 요소가 포함될 수 있습니다.
- 선의 굵기와 형태
- 명암 표현 방식
- 채색 방식
- 색상 조합
- 빛과 그림자 표현
- 전체적인 그림 분위기
예를 들어 1990년대 셀 애니메이션 느낌의 이미지로 Style LoRA를 학습했다면, 학습이 잘된 LoRA는 사람, 동물, 도시, 숲처럼 서로 다른 대상을 생성하더라도 비슷한 선화와 채색 방식으로 표현할 수 있어야 합니다.
즉, Style LoRA의 목표는 학습 이미지를 그대로 따라 만드는 것이 아니라, 다양한 소재와 구도에서도 목표 스타일을 일관되게 유지하는 것입니다.
Style LoRA의 성능은 크게 두 요소의 영향을 받습니다.
- 데이터셋을 어떻게 구성했는가
- 학습 파라미터를 어떻게 설정했는가
일반적으로는 학습 파라미터보다도 데이터셋의 품질과 구성이 먼저입니다. 데이터가 잘못 구성되어 있다면 Step이나 Learning Rate를 아무리 조정해도 좋은 결과를 얻기 어렵습니다.
2. Style LoRA 데이터셋 구성 방법
2.1 데이터는 어디서 구해야 할까?
Style LoRA용 이미지는 다음과 같은 방법으로 준비할 수 있습니다.
- 직접 제작한 이미지
- 라이선스상 학습에 사용할 수 있는 이미지
- 이미지 생성 모델로 직접 만든 이미지
- 공개 데이터셋
- ComfyUI 등의 워크플로로 생성한 이미지
보통 대부분 CivitAI에서 특정 Style LoRA 체크포인트를 다운로드 후 ComfyUI로 학습 이미지를 직접 생성하는 방법도 있습니다. ComfyUI를 활용해 학습 이미지를 생성하는 방법은 추후 별도의 블로그 글에서 자세히 소개하겠습니다.
현재 Toonkit의 My Style LoRA 학습하기 기능에서는 다음 두 가지 방식으로 학습 데이터를 준비할 수 있습니다.
- 스타일 업로드: 사용자가 직접 준비한 이미지들을 업로드하여 Style LoRA를 학습하는 방식입니다. ComfyUI 등으로 생성한 동일한 스타일의 이미지가 있다면 이 기능을 활용할 수 있습니다.
- 스타일 생성: Anima 모델과 프롬프트를 이용해 사용자가 원하는 스타일의 이미지를 Toonkit에서 직접 생성하는 방식입니다.
이번 글에서는 두 가지 방식 중 스타일 업로드를 기준으로, Style LoRA 학습용 데이터셋을 어떻게 구성하면 좋은지 설명하겠습니다.
2.2 스타일은 일관되고 내용은 다양해야 한다
Style LoRA 데이터 구성에서 가장 중요한 원칙은 다음 한 문장으로 정리할 수 있습니다.
“그림 스타일은 일관되게 유지하되, 이미지마다 인물, 구도, 포즈, 배경 등의 내용은 다양하게 구성해야 합니다.”
동일하게 유지해야 하는 스타일 요소
- 선화 방식
- 채색 방식
- 명암 단계
- 질감
- 형태 단순화 방식
- 전체적인 화풍
- 목표 스타일에 포함되는 색감
다양하게 구성해야 하는 요소
- 인물과 사물
- 성별과 연령
- 헤어스타일과 의상
- 얼굴 표정
- 포즈
- 카메라 뷰
- 배경
- 시간대
- 날씨
- 화면 비율
예를 들어 캐릭터 Style LoRA를 학습하는데 모든 데이터가 정면을 바라보는 여성의 상반신 이미지로만 구성되어 있다고 가정해 보겠습니다. 이 경우 LoRA는 그림 스타일뿐만 아니라 다음과 같은 특징까지 함께 학습할 수 있습니다.
- 항상 여성만 생성
- 상반신 구도만 생성
- 정면 얼굴을 선호
- 비슷한 헤어스타일 반복
- 비슷한 표정 반복
즉, LoRA가 스타일과 관계없는 인물이나 구도까지 스타일의 일부로 잘못 학습할 수 있습니다. 이를 데이터 편향이라고 합니다.
좋은 Style LoRA는 목표 스타일을 일관되게 표현하면서도, 프롬프트에 따라 다양한 인물과 사물, 배경과 구도를 자유롭게 생성할 수 있어야 합니다.
2.3 여러 스타일을 하나의 데이터셋에 섞지 않는다
2.3_kr.png
Style LoRA를 학습할 때는 모든 이미지가 목표로 하는 스타일을 명확하게 공유해야 합니다.
예를 들어 다음 이미지들을 하나의 데이터셋에 섞으면 학습이 어려워질 수 있습니다.
- 셀 애니메이션 이미지
- 두꺼운 유화 이미지
- 수채화 이미지
- 반실사 디지털 페인팅
- 3D 렌더링 이미지
여러 작가의 이미지를 사용하더라도 선화, 채색, 질감, 인체 표현 방식이 충분히 비슷하지 않다면 모델 입장에서는 무엇이 목표 스타일인지 판단하기 어렵습니다.
핵심은 다음과 같습니다.
“무엇을 스타일로 학습시킬지 먼저 정의한 뒤, 그 요소는 공통으로 유지해야 합니다.”
2.4 학습 이미지 20장은 어떻게 구성해야 할까?
2.4_kr.png
현재 Toonkit의 My Style LoRA 학습하기 기능에는 총 20장의 이미지를 업로드할 수 있습니다.
이미지 수가 정해져 있기 때문에 단순히 20장을 채우기보다, 각 이미지의 품질과 다양성을 꼼꼼하게 확인하는 것이 중요합니다.
목표 스타일은 모든 이미지에서 일관되게 유지하되, 인물, 포즈, 구도, 배경 등의 내용은 이미지마다 다양하게 구성하는 것이 좋습니다.
특히 다음과 같은 중복되거나 비슷한 이미지는 가능한 한 제외해 주세요.
- 동일한 이미지의 크기만 변경한 버전
- 얼굴 표정만 조금 달라진 이미지
- 같은 구도에서 색상만 바뀐 이미지
- 같은 Seed로 생성해 결과가 거의 동일한 이미지
- 동일한 캐릭터와 포즈가 반복되는 이미지
비슷한 이미지가 많으면 모델이 특정 캐릭터나 구도를 스타일의 일부로 잘못 학습할 수 있습니다. 따라서 정면 상반신 이미지로만 20장을 구성하기보다 얼굴 클로즈업, 상반신, 전신, 측면, 다양한 포즈와 배경을 골고루 포함하는 것이 좋습니다.
이미지의 품질도 반드시 확인해야 합니다. Style LoRA는 좋은 스타일뿐만 아니라 이미지에 포함된 오류도 함께 학습할 수 있습니다.
다음과 같은 문제가 있는 이미지는 가능한 한 제외해 주세요.
- 손가락이나 신체 형태가 어색한 이미지
- 얼굴이나 눈이 무너진 이미지
- 워터마크가 포함된 이미지
- 의미를 알 수 없는 글자가 포함된 이미지
- 심하게 흐리거나 깨진 이미지
- JPEG 압축 흔적이 심한 이미지
- 불필요한 테두리가 포함된 이미지
다만 필름 그레인이나 거친 인쇄 질감처럼 목표 스타일에 의도적으로 포함된 표현은 유지해도 괜찮습니다. 중요한 것은 스타일을 표현하는 질감과 단순한 이미지 오류를 구분하는 것입니다.
결국 좋은 Style LoRA를 만들기 위해서는 제한된 20장 안에서 중복과 오류를 줄이고, 스타일은 일관되게 유지하면서 다양한 내용을 구성해야 합니다.
2.5 캐릭터용 Style LoRA 데이터 구성
2.5.png
캐릭터 중심의 Style LoRA를 만들고 싶다면 특정 캐릭터 한 명만 반복하기보다, 다양한 특징을 가진 캐릭터 이미지를 구성하는 것이 좋습니다.
예를 들면 다음과 같이 구성할 수 있습니다.
- 남성과 여성
- 어린이, 청년, 중년, 노인
- 전신, 반신, 얼굴 클로즈업
- 정면, 측면, 뒷모습
- 로우 앵글과 하이 앵글
- 앉기, 걷기, 달리기
- 다양한 표정
- 다양한 체형
- 다양한 헤어스타일
- 다양한 의상
- 1인 장면과 다인 장면
또한 캐릭터용 Style LoRA라고 해서 모든 이미지를 캐릭터만 크게 보이고 배경은 비어 있는 형태로 구성하는 것은 좋지 않습니다.
Style LoRA는 캐릭터의 얼굴과 의상뿐만 아니라 이미지 전체에 나타나는 색감, 질감, 조명, 명암 표현과 배경 묘사 방식도 함께 학습합니다. 따라서 일부 이미지에는 목표 스타일이 잘 드러나는 소품, 실내 공간, 거리, 자연 풍경 등의 배경을 포함하는 것이 좋습니다.
특정 얼굴형이나 특정 의상이 지나치게 반복되면 LoRA가 그것을 스타일의 일부로 오해할 수 있습니다.
2.6 배경용 Style LoRA 데이터 구성
2.6.png
배경 중심의 Style LoRA를 만들고 싶다면 특정 장소나 시간대만 반복하지 않는 것이 좋습니다.
예를 들어 다음과 같이 구성할 수 있습니다.
- 자연 풍경
- 숲
- 산
- 바다
- 시골
- 골목
- 대도시
- 건물 내부
- 낮과 밤
- 맑은 날과 흐린 날
- 비와 눈
- 넓은 원경
- 중경
- 건축물 클로즈업
예를 들어 모든 이미지가 도시 야경으로만 구성되어 있다면, 숲이나 실내를 요청해도 도시의 조명이나 건축 요소가 함께 나타날 수 있습니다.
2.7 캐릭터와 배경을 함께 학습하는 경우
캐릭터와 배경을 같은 스타일로 생성하고 싶다면 두 종류의 이미지를 함께 구성할 수 있습니다.
Toonkit에 업로드할 수 있는 이미지가 총 20장이라면 다음과 같이 구성할 수 있습니다.
- 캐릭터 이미지 10장
- 배경 이미지 10장
반드시 같은 비율로 나눌 필요는 없습니다. 캐릭터 생성이 더 중요하다면 캐릭터 이미지의 비중을 높이고, 배경 생성이 더 중요하다면 배경 이미지의 비중을 높이면 됩니다.
이 비율은 학습을 시작하기 위한 예시이며 절대적인 기준은 아닙니다. 사용 목적에 맞게 이미지 비율을 조절하고, 생성 결과를 비교하면서 가장 적절한 구성을 찾는 것이 중요합니다.
2.8 이미지 해상도와 비율은 어떻게 준비해야 할까?
이미지의 해상도와 비율은 주로 생성하고 싶은 결과물에 맞춰 구성하는 것이 좋습니다.
정사각형 이미지를 주로 생성할 예정이라면 정사각형 이미지를 중심으로 준비할 수 있습니다. 반대로 가로형, 세로형, 정사각형 등 다양한 비율의 이미지를 생성하고 싶다면 학습 데이터에도 여러 비율의 이미지를 골고루 포함하는 것이 좋습니다.
다만 이미지의 가로와 세로를 억지로 늘려 형태가 찌그러지지 않도록 주의해야 합니다. 해상도가 너무 낮은 이미지를 크게 확대하면 화면이 흐려지거나 깨질 수 있으므로 피하는 것이 좋습니다.
해상도와 비율에 하나의 정답이 있는 것은 아닙니다. 다만 너무 작은 이미지나 왜곡된 이미지는 제외하고, 주로 생성할 이미지의 크기와 비율을 고려해 데이터셋을 구성하는 것이 중요합니다.
3. Style LoRA 캡션 작성 방법
3.1 캡션은 왜 필요하고, 어떻게 작성해야 할까?
3.1.png
캡션은 모델에게 이미지 안에 무엇이 들어 있는지 알려주는 설명입니다.
예를 들어 이미지에 붉은 머리 여성, 검은 코트, 비 오는 도시, 밤 장면이 보인다면 다음과 같이 작성할 수 있습니다.
1girl, red hair, black coat, rainy city, night, low angle
이렇게 인물, 의상, 배경, 구도 등을 캡션에 적으면 모델이 해당 요소를 이미지의 내용으로 구분하기 쉬워집니다.
반대로 Style LoRA를 학습할 때는 선화, 채색 방식, 질감, 색감처럼 학습하려는 스타일에 대한 설명은 캡션에서 제외하는 것이 좋습니다.
쉽게 정리하면 다음과 같습니다.
- 캡션에 적힌 요소는 이미지의 내용으로 학습하고, 캡션에는 없지만 여러 이미지에서 공통으로 나타나는 표현은 스타일로 학습하도록 만드는 것입니다.
따라서 anime, watercolor, cinematic처럼 스타일을 직접 설명하는 단어는 제외하고, 이미지에 실제로 보이는 인물, 의상, 배경, 시간대, 구도 등의 내용은 충분히 작성하는 것이 좋습니다.
캡션을 너무 간단하게 작성하면 검은 코트, 비 오는 도시, 특정 구도처럼 스타일과 관계없는 요소까지 스타일의 일부로 함께 학습될 수 있습니다.
필요하다면 모든 캡션의 앞에 동일한 트리거 단어를 추가할 수도 있습니다.
tk90cel, 1girl, red hair, black coat, rainy city, night
트리거 단어는 학습한 스타일을 불러오기 위한 고유한 단어입니다. 이미지 생성 시 프롬프트에 tk90cel을 입력하면 해당 Style LoRA의 스타일을 더 명확하게 적용하는 데 도움이 될 수 있습니다.
트리거 단어는 기존 단어와 의미가 겹치지 않는 프로젝트 전용 표현을 사용하고, 모든 학습 이미지의 캡션에 동일하게 넣는 것이 좋습니다.
3.2 태그형과 문장형 중 무엇이 좋을까?
캡션은 태그형과 문장형 모두 사용할 수 있습니다.
태그형 예시
tk90cel, 1girl, short hair, white jacket, upper body, night city
태그형은 이미지의 요소를 간단하게 정리하기 좋습니다.
문장형 예시
tk90cel, a young woman with short hair wearing a white jacket stands in a city at night.
문장형은 인물의 행동이나 배경, 여러 요소의 관계를 자연스럽게 설명하기 좋습니다.
최근 이미지 생성 모델은 자연어 문장과 복잡한 설명을 더 잘 이해하는 방향으로 발전하고 있습니다.
Toonkit 팀에서는 특별한 이유가 없다면 문장형 캡션을 사용하는 것을 추천합니다. 초보자도 이미지의 내용을 빠뜨리지 않고 비교적 자세하게 설명하기 쉽기 때문입니다.
다만 사용하는 모델이나 데이터에 따라 결과가 달라질 수 있으므로, 두 방식을 직접 실험해 보는 것도 좋습니다. 어떤 방식을 사용하든 데이터셋 안에서는 캡션 형식을 일정하게 유지하는 것이 중요합니다.
3.3 캡션에 포함하면 좋은 내용
가능한 경우 다음 요소를 작성합니다.
- 인물 수
- 대상의 종류
- 성별과 연령대
- 헤어스타일
- 의상
- 행동
- 포즈
- 표정
- 배경
- 시간대
- 날씨
- 카메라 거리
- 카메라 각도
- 중요한 소품
하지만 눈에 보이는 모든 요소를 지나치게 길게 작성할 필요는 없습니다.
나중에 이미지를 생성할 때 프롬프트로 바꾸고 싶은 요소를 중심으로 작성하면 됩니다. 예를 들어 헤어스타일, 의상, 표정, 배경, 구도 등을 자유롭게 바꾸고 싶다면 이러한 내용을 캡션에 적어주는 것이 좋습니다.
4. Style LoRA 학습 파라미터 설정
Style LoRA는 학습 파라미터에 따라 스타일 반영도와 생성 유연성이 크게 달라질 수 있습니다.
대표적으로 다음 세 가지가 중요합니다.
- Training Step
- Network Dim(Rank)
- Learning Rate
Network Dim은 학습 도구에 따라 Rank라고 표시되기도 하며, 두 용어는 같은 의미로 사용됩니다.
이 세 가지 파라미터는 각각 따로 작동하는 것이 아니라 서로 영향을 줍니다.
예를 들어 Network Dim을 높이면 LoRA가 학습할 수 있는 정보의 양이 늘어납니다. 따라서 같은 Learning Rate와 Training Step을 사용하더라도 학습 결과가 달라질 수 있습니다.
그렇기 때문에 한 가지 값만 따로 조절하기보다 세 파라미터의 관계를 함께 이해하는 것이 중요합니다.
4.1 Training Step
Training Step은 학습 과정에서 LoRA의 가중치를 몇 번 업데이트할지를 나타내는 값입니다.
쉽게 말하면 LoRA가 데이터셋을 보며 학습을 얼마나 반복할지를 정하는 값이라고 이해하면 됩니다.
Step이 너무 적은 경우
- 스타일이 약하게 반영된다.
- 선화나 색감 일부만 반영된다.
- LoRA를 높은 강도로 사용해야 한다.
- 학습 이미지의 특징이 충분히 나타나지 않는다.
이처럼 학습이 충분히 이루어지지 않은 상태를 과소학습(Underfitting)이라고 합니다.
Step이 너무 많은 경우
- 학습 이미지와 비슷한 구도만 반복한다.
- 특정 인물이나 의상이 계속 나타난다.
- 다른 프롬프트를 잘 따르지 않는다.
- 색상이 지나치게 강해진다.
- 얼굴과 배경이 무너질 수 있다.
- LoRA 강도를 낮춰도 스타일이 과도하게 적용된다.
이를 과적합 또는 Overfitting이라고 합니다.
이처럼 학습 데이터를 지나치게 많이 외운 상태를 과적합(Overfitting)이라고 합니다.
Training Step은 Learning Rate와 함께 영향을 줍니다. Learning Rate가 높은 상태에서 Step까지 많으면 과적합이 빠르게 발생할 수 있으므로, 두 값을 함께 조절하는 것이 중요합니다.
4.2 Training Step은 어느 정도로 시작하면 좋을까?
Toonkit에서는 총 20장의 이미지로 Style LoRA를 학습합니다.
20장의 데이터를 기준으로 처음 학습한다면 다음 범위에서 시작해 볼 수 있습니다.
- 단순한 스타일: 약 1,000~2,000 Step
- 일반적인 스타일: 약 1,500~3,000 Step
- 표현이 복잡하고 디테일이 많은 스타일: 약 2,500~4,000 Step
다만 이 값은 모든 스타일에 똑같이 적용되는 정답이 아니라, 학습을 시작하기 위한 참고 범위입니다.
같은 20장의 이미지라도 스타일의 복잡도, 이미지 품질, Learning Rate 등의 설정에 따라 적절한 Step이 달라질 수 있습니다.
가능하다면 최종 결과 하나만 확인하기보다 다음과 같이 중간 단계의 결과도 함께 저장해 비교하는 것이 좋습니다.
- 1,000 Step
- 1,500 Step
- 2,000 Step
- 2,500 Step
- 3,000 Step
각 단계의 LoRA를 동일한 프롬프트와 Seed로 테스트하면, 스타일이 충분히 반영되면서도 과적합되지 않은 결과를 찾기 쉽습니다.
Step이 높을수록 무조건 좋은 것은 아닙니다. 스타일이 충분히 반영되기 시작한 이후에는 Step을 더 늘릴수록 특정 인물이나 구도까지 함께 외울 수 있으므로, 여러 단계의 결과를 비교하는 것이 중요합니다.
4.3 Rank
Rank는 LoRA가 스타일의 특징을 얼마나 많이 학습할 수 있는지를 정하는 값입니다.
Toonkit의 My Style LoRA 학습하기 기능에서는 Rank를 Network Dim이라는 이름으로 표시합니다. 이름만 다를 뿐 같은 의미입니다.
쉽게 말하면 Rank는 LoRA가 스타일을 기록할 수 있는 공책의 크기와 비슷합니다.
공책이 너무 작으면 선화, 색감, 질감처럼 스타일의 다양한 특징을 충분히 기록하지 못할 수 있습니다. 반대로 공책이 너무 크면 스타일뿐 아니라 특정 캐릭터, 의상, 배경과 같은 불필요한 특징까지 함께 외울 가능성이 커집니다.
따라서 Rank는 높을수록 무조건 좋은 것이 아니라, 학습하려는 스타일의 복잡도에 맞게 설정하는 것이 중요합니다.
처음에는 다음 값을 기준으로 시작해 볼 수 있습니다.
- Rank 8: 단순한 스타일 또는 가벼운 테스트
- Rank 16: 일반적인 Style LoRA의 시작값
- Rank 32: 질감과 디테일이 많은 복잡한 스타일
처음 학습한다면 Rank 16부터 시작하는 것을 추천합니다. 스타일 표현이 부족하다면 Rank 32로 높여 결과를 비교해 볼 수 있습니다.
특히 Toonkit처럼 학습 이미지가 20장으로 제한되어 있다면, 처음부터 Rank를 지나치게 높이기보다 Rank 16 또는 32 안에서 테스트하는 것이 좋습니다.
4.4 Learning Rate
Learning Rate는 학습할 때 새로운 내용을 한 번에 얼마나 크게 반영할지를 정하는 값입니다.
값이 너무 높으면 스타일을 빠르게 학습할 수 있지만, 색감이나 질감이 지나치게 강해지거나 이미지가 불안정해질 수 있습니다. 또한 특정 특징을 과하게 학습해 프롬프트를 잘 따르지 않는 과적합이 발생할 수도 있습니다.
반대로 값이 너무 낮으면 학습 속도가 느려지고, 학습이 끝난 뒤에도 스타일이 약하게 적용될 수 있습니다.
초보자는 다음 값을 기준으로 시작해 볼 수 있습니다.
5e-5: 비교적 안정적으로 학습할 수 있는 값1e-4: 일반적으로 사용하기 좋은 시작값2e-4: 빠르게 학습되지만 과적합에 주의해야 하는 값
처음에는 5e-5 또는 1e-4로 학습한 뒤 결과를 비교하면서 조절하는 것이 좋습니다.
특히 학습 이미지가 적거나 Training Step이 많다면 높은 Learning Rate를 사용할수록 과적합이 빠르게 발생할 수 있으므로 주의해야 합니다.
5. 결론: 데이터와 파라미터 중 무엇이 더 중요할까?
좋은 Style LoRA를 만들기 위해서는 다음 요소를 순서대로 확인하는 것이 좋습니다.
- 목표 스타일이 명확하게 드러나는 고품질 이미지
- 인물, 구도, 배경 등이 다양하게 구성된 데이터
- 이미지의 내용을 정확하게 설명하는 캡션
- 적절한 Training Step과 Learning Rate
- 스타일의 복잡도에 맞는 Network Dim
- 학습 결과를 직접 생성하고 비교하는 과정
결과가 좋지 않으면 Training Step이나 Network Dim과 같은 학습 파라미터부터 바꾸기 쉽습니다.
하지만 데이터셋에 다음과 같은 문제가 있다면 파라미터만 조절해서 해결하기는 어렵습니다.
- 이미지마다 스타일이 서로 다름
- 비슷한 구도가 반복됨
- 특정 캐릭터나 의상의 비중이 너무 높음
- 캡션이 이미지의 내용을 정확하게 설명하지 못함
- 흐리거나 품질이 낮은 이미지가 포함됨
- 워터마크나 신체 오류 등이 포함됨
결국 Style LoRA 학습에서 가장 중요한 것은 다음 두 가지를 구분하는 것입니다.
- 모델이 어떤 특징을 스타일로 배우고, 어떤 특징을 프롬프트로 제어해야 하는가?
예를 들어 선화, 채색 방식, 질감은 Style LoRA가 학습해야 할 요소입니다. 반면 캐릭터의 헤어스타일, 의상, 포즈, 배경은 생성할 때 프롬프트로 바꿀 수 있어야 합니다.
이 기준에 맞춰 데이터와 캡션을 구성하면 학습 이미지를 단순히 따라 하는 LoRA가 아니라, 다양한 인물과 배경에서도 목표 화풍을 일관되게 표현하는 Style LoRA를 만들 수 있습니다.
무엇보다 좋은 결과를 만드는 데 가장 큰 영향을 주는 것은 학습 파라미터보다 데이터셋의 품질과 구성이라는 점을 기억해 주세요.
6. 마무리
지금까지 Style LoRA의 성능을 높이기 위한 데이터셋 구성 방법과 주요 학습 파라미터를 알아보았습니다.
처음부터 완벽한 결과를 만들려고 하기보다는 이번 글에서 소개한 기준으로 학습을 시작한 뒤, 생성 결과를 비교하면서 이미지 구성과 파라미터를 조금씩 조절해 보세요.
같은 설정이라도 학습하려는 스타일과 데이터에 따라 결과가 달라질 수 있기 때문에, 여러 번 테스트하면서 자신의 목적에 가장 잘 맞는 설정을 찾는 과정이 중요합니다.
Toonkit의 My Style LoRA 학습하기 기능을 활용해 나만의 스타일을 직접 만들어 보세요!
다음 글에서는 ComfyUI를 활용해 Style LoRA 학습용 이미지를 준비하는 방법을 쉽고 자세하게 소개하겠습니다.