Разметка датасета LoRA в AI Toolkit: как писать подписи к изображениям
Хотите обучить LoRA на человеке. Собираете фотографии, запускаете AI Toolkit, а потом просите этого человека на пляже. Он появляется. В той самой куртке. За тем самым столом. Пляж, видимо, подождёт.
При такой проблеме стоит проверить датасет и подписи к нему. Это руководство по разметке датасета LoRA в AI Toolkit: что писать в captions, как использовать trigger word и как выбирать детали для описания. Без установки Python и экскурсии по настройкам видеокарты.
Речь об обычном обучении по изображениям. Для видео и моделей редактирования изображений нужны другие примеры разметки. Все иллюстрации ниже сгенерированы специально для статьи. Это учебные сцены, а не результаты сравнения обученных LoRA.
Как подписи к изображениям помогают обучению LoRA
Во время обучения модель получает картинку и связанный с ней текст. Поэтому имеет значение не только то, что лежит в папке, но и то, как вы это называете.
Допустим, персонаж на фотографии сидит. Если сидячую позу хочется потом менять, её имеет смысл назвать в подписи. Такой подход показан в небольшом эксперименте с подписями к фотографиям собаки. Это пример, а не гарантия для любой модели.
Полезный вопрос перед разметкой: что должно остаться узнаваемым, когда я поменяю сцену? Для человека это может быть внешность. Для стиля — способ изображения. Для товара — конкретный дизайн.
Разметка для персонажа, стиля и предмета
Удобно сначала разделить цель обучения и условия, которыми вы хотите управлять. Ниже — рабочая схема для примеров этой статьи. Она помогает начать, но не заменяет проверку на вашей базовой модели.
| Тип LoRA | Что сохраняем | Что описываем в captions |
|---|---|---|
| Человек или персонаж | Узнаваемую внешность | Одежду, действие, позу, ракурс, окружение |
| Стиль | Общий визуальный почерк | Предметы, персонажей и события в сцене |
| Предмет или товар | Конкретный дизайн объекта | Ракурс, расположение, окружение и изменяемое состояние |
Например, синяя куртка может быть случайной одеждой человека. А может быть частью костюма персонажа, которую нужно сохранять. Одинаковая картинка, две разные задачи разметки. Решение принимается до того, как автокапшенер начнёт старательно описывать каждый шов.
Как подписывать датасет для LoRA персонажа
Познакомимся с Мирой. Это вымышленный персонаж, которого мы используем только для примеров. В подписях будем называть её Mira. Во всех четырёх кадрах сохраняется образ одного человека, а одежда, фон и крупность меняются.

Кадр 1 — кафе и джинсовая куртка
A medium shot of Mira wearing a blue denim jacket over a white shirt, sitting at a wooden table in a café and looking at the camera.Кадр 2 — профиль на улице
A close-up side profile of Mira wearing a white T-shirt outdoors, with blurred trees in the background.Кадр 3 — фото в полный рост
A full-body photo of Mira wearing a dark green sweater and black trousers, standing on a city sidewalk.Кадр 4 — у окна
A medium shot of Mira wearing a rust orange cardigan over a cream shirt, sitting beside a window, smiling and looking away.Здесь подписи отвечают на конкретные вопросы: что Мира делает, во что одета, как показана и где находится. Мы не пытаемся составить словесный фоторобот.
Не описывать подробно постоянные черты внешности — один из подходов для LoRA персонажа. Но превращать его в запрет на цвет волос, очки или любую другую особенность не стоит. Если вы хотите менять причёску по запросу, она становится изменяемым условием. Если очки являются частью образа, цель уже другая. Общая идея выбирать значимые детали, а не перечислять всё подряд, разобрана у Alvdansen в заметке о captioning; её наблюдения прежде всего относятся к SDXL.
Хорошая подпись не обязана быть длинной
Для первого кадра можно написать так:
A stunning woman with perfect skin, beautiful brown hair, gorgeous eyes, an elegant face and an amazing cinematic atmosphere, masterpiece, 8k.
Получилась рекламная похвала. Куртка, стол и кафе куда-то исчезли. «Идеальная кожа» и «великолепные глаза» тоже не помогают понять, какое именно видимое условие мы обозначаем.
Наш вариант проще:
A medium shot of Mira wearing a blue denim jacket, sitting at a wooden table in a café.
Это не соревнование на минимальное число слов. Если человек держит важный предмет или в кадре есть второй участник, добавьте эту информацию. Если подробность не видна или вы в ней не уверены, не угадывайте.
Для этих примеров выбраны короткие английские предложения. Это удобный старт, а не обязательный язык или формат AI Toolkit. Не существует одной правильной длины подписи, которую нужно подгонять линейкой.
Как подписывать датасет для LoRA стиля
Теперь задача меняется. Нам нужен общий визуальный почерк: бумажная фактура, упрощённые формы и узнаваемая подача. А лиса, чайник и велосипедист должны свободно заменяться другими сюжетами.

Кадр 1 — лиса
A fox sitting beside flowers and leafy plants on a grassy mound, in vellumcut style.Кадр 2 — натюрморт
A teapot, a cup and a vase with leafy branches on a wooden table, in vellumcut style.Кадр 3 — дом
A small cottage among tall trees and hills, with a winding path leading to the door, in vellumcut style.Кадр 4 — велосипедист
A cyclist wearing a helmet and a backpack rides along a path beside a tree, in vellumcut style.В этом варианте мы описываем содержание и добавляем in vellumcut style. Подробный разбор фактуры и техники оставляем за именем стиля. Такой способ отделять сюжет от визуальной манеры описан в практическом материале fal об обучении FLUX Style LoRA.
Широкое слово вроде illustration при необходимости можно оставить. Оно обозначает тип изображения, а не весь ваш авторский почерк. Главное — понимать, какую роль играет каждое повторяющееся описание.
Как подписывать датасет для LoRA предмета или товара
Возьмём кружку с условным именем talomug. Цель этого примера — воспроизводить конкретную кружку, включая её форму и цвет. Место съёмки и наличие кофе хотим менять.

Кадр 1 — деревянный стол
A photo of a talomug mug on a wooden table in a kitchen, viewed from a three-quarter angle.Кадр 2 — каменная поверхность и кофе
A photo of a talomug mug filled with coffee on a stone countertop against a gray background.Название и слово mug обозначают объект, остальной текст — условия кадра. Мы не дублируем в каждой подписи подробное описание его граней и ручки.
Если цель — получать этот дизайн в разных цветах, решение меняется: цвет стоит рассматривать как управляемый признак и подбирать соответствующие изображения. Подпись «синяя кружка» сама по себе не показывает модели эту кружку в красном.
Trigger word и файлы captions в AI Toolkit
Trigger word — имя или фраза, которую вы используете для связи с изучаемым образом. Для наших примеров это Mira, vellumcut style и talomug. Написание должно быть последовательным. Обычное имя тоже может пересекаться с тем, что модель уже знает, поэтому проверяйте его на своей базовой модели.
В простом формате датасета с изображениями и TXT подпись для AI Toolkit хранится в текстовом файле с тем же именем, что и картинка:
mira_001.jpg
mira_001.txt
mira_002.jpg
mira_002.txt
Внутри mira_001.txt находится только подпись. Если в конфигурации задан trigger_word, AI Toolkit может заменить маркер [trigger] в её тексте. Это описано в официальном разделе Dataset Preparation.
A medium shot of [trigger] wearing a blue denim jacket, sitting at a wooden table in a café.
Сам маркер не выбирает стратегию разметки. Он подставляет текст. Решить, что связывать с именем, а что описывать отдельно, всё равно нужно вам.
Как использовать автокапшенер для разметки LoRA
Автоматическая подпись полезна как черновик. Проверять её удобнее рядом с изображением: не придуманы ли предметы, верно ли названы одежда и поза, не перепутаны ли участники сцены.
Для персонажа можно начать с такого собственного задания модели:
Write a concise English training caption for this image.
Refer to the target person as Mira.
Describe visible clothing, action, pose, framing and setting.
Do not guess details or add praise.
Keep permanent identity traits out of the caption unless I explicitly want to control them.
Return only the caption.
Это шаблон для нашей задачи, а не универсальный промпт. Для стиля замените правила: попросите описывать сюжет и добавлять выбранное имя стиля. Для товара — использовать его имя и отмечать условия съёмки.
Не запускайте одно задание «опиши всё максимально подробно» на все три типа датасетов. Сначала определите цель, затем задайте правила автокапшенеру, потом исправьте его черновики.
В редакторе подписей Curaset можно сверить текст с изображением и исправить готовые TXT. Он не создаёт ИИ-подписи. Правила ручной и массовой правки разобраны в руководстве по подписям LoRA.
Проверка датасета перед обучением LoRA
Практический вариант проверки — открыть всю подборку и пройтись по шести пунктам:
- Одна понятная цель. Вы можете одним предложением объяснить, что должна воспроизводить LoRA.
- Разные условия. Для персонажа есть полезные изменения ракурса, одежды и окружения. Для стиля — разные сюжеты.
- Нет лишних дублей. Похожие кадры оставлены осознанно, а не просто увеличивают размер папки.
- Подписи совпадают с картинками. Автокапшенер не придумал сумку, улыбку или цвет глаз, которых не видно.
- Имена последовательны. Один образ не называется по очереди
Mira,mira_personиthe girlбез причины. - Есть проверочные запросы. После обучения вы сможете проверить новую одежду, фон или сюжет, а не только повторить учебную сцену.
Подписи помогают обозначить условия, но не заменяют разнообразие изображений. Если все кадры сняты в одной куртке на одном диване, начните с вопроса, достаточно ли в подборке других условий. Дописать слово «диван» быстрее, чем переснять материал. Но это не делает фотографии разнообразнее.
Универсального числа фотографий здесь нет. Для первой подборки полезнее оценить, что добавляет каждый кадр, чем гнаться за круглым числом файлов.
Частые вопросы о разметке датасета LoRA
Можно оставить только trigger word? Можно рассматривать это как простой исходный вариант. Но он не называет отдельно одежду, позы и окружение. Если нужна гибкость этих условий, сравните его с осмысленными описаниями.
Нужно писать цвет волос? Сначала решите, является ли он постоянной частью образа или признаком, который хотите менять. Ответ зависит от цели LoRA, а не от самого слова «волосы».
Что лучше: теги или предложения? Подбирайте формат под базовую модель и будущие запросы. Для примеров в статье использованы короткие предложения. Коммы, теги и длинные абзацы не дают качества сами по себе.
Эти картинки показывают, что подход работает? Они показывают, как может выглядеть разметка. Для проверки результата нужно обучить LoRA и сравнить генерации. Учебные иллюстрации не заменяют такой тест.
Начните с трёх изображений: подпишите их вручную, объясните себе выбор деталей и только потом переносите правило на остальной датасет. Так гораздо проще заметить, что вы на самом деле собираетесь учить.