一致的 AI 角色,是換了衣服、姿勢、地點、表情與光線後,觀眾仍然認得出同一個人。目標不是複製同一張圖片,而是在鏡頭改變時保留身份。
角色一致性有四種常見控制方式:
| 方法 | 控制內容 | 最適合 | 主要限制 |
|---|---|---|---|
| 重複身份提示詞 | 文字描述的特徵 | 早期角色探索 | 場景複雜後臉容易漂移 |
| 固定 seed | 受控比較 | 測試單一提示詞改動 | 不是永久身份 |
| 參考圖片 | 單次生成的視覺相似度 | 經授權的一次性圖片 | 姿勢、裁切與光線可能一起滲入 |
| 角色 LoRA | 可重複使用的已學習身份 | 長期出現的虛構角色 | 需要乾淨資料集、相容基礎模型與驗收 |
先用提示詞探索。只有當角色成為需要反覆使用的資產,才值得訓練 LoRA。
LoRA 是什麼?
LoRA 全名是 Low-Rank Adaptation(低秩適應)。原始 LoRA 論文的核心做法,是凍結預訓練模型,另外學習一組小很多的更新矩陣,而不是改動模型的所有權重。
簡化後可以理解為:
調整後的 W = 原始 W + scale × (B × A)
A 與 B 的 rank 很小,因此 adapter 的可訓練參數遠少於完整模型。套用到圖片模型時,這些更新可以讓 denoiser 或 transformer 學會某個角色身份、風格、物件或視覺概念。Hugging Face Diffusers 文件也把 LoRA 定義為可載入 denoiser、text encoder 或兩者的輕量 adapter。
實務上有三個重要結果:
- LoRA 不是完整圖片模型。 Adapter 通常是一個
.safetensors檔,仍然需要相容的基礎模型。 - Trigger word 只是標籤,不是身份本身。 真正的身份來自資料集與已訓練權重。
- LoRA weight 不是越大越好。 太強可能保住臉,卻犧牲表情、服裝、構圖與真實感。
LoRA 提高身份一致性,但不會取代提示詞結構、姿勢控制、構圖或美術指導。
1. 在做資料集之前先選基礎模型
角色 adapter 會綁定訓練時使用的模型架構與 checkpoint 家族。用一個 base 訓練,卻放進不相容的 pipeline,可能完全無法載入,也可能只產生微弱或扭曲的結果。
Elyvie 把 Z-Image 分成兩條路徑:
- 免費公開生成器使用 Tongyi-MAI/Z-Image-Turbo,適合快速探索提示詞;
- 受控角色訓練流程使用未蒸餾的 Tongyi-MAI/Z-Image 基礎版。
這是刻意區分。Z-Image 官方 model card把基礎版列為適合 LoRA 訓練,Turbo 則列為不可 fine-tune。基礎版也支援 CFG、negative prompt 與 28–50 steps 的推理路徑;Turbo 的重點是速度。
不要先訓練,再決定正式環境用哪個模型。收集圖片前就要記錄確切 base model、revision、訓練工具、adapter 格式與推理 loader。
為什麼開源、開放權重圖片模型是 Elyvie 的必要條件
封閉圖片 API 很適合回答「這段提示詞能不能做出好看的圖?」但 Elyvie 面對的是更難的問題:「當模型、場景、服裝與產品功能持續改變時,這個虛構人物能不能幾個月後仍是同一個角色?」
這需要同時控制四種資產:
- 定義視覺先驗的 base model;
- 保存已學習身份的 LoRA adapter;
- Loader、scheduler、steps、CFG、seed、尺寸、negative prompt 與 adapter weight 組成的推理配方;
- Dataset manifest、captions、checkpoints 與 validation renders 組成的證據。
封閉 API 背後的模型可能在同一個名稱下更新,也可能移除參數、改變 adapter 格式或停止 fine-tuning。即使這些更新都合理,角色仍可能換臉,而且你未必能拿回舊 checkpoint 重現過去結果。
開放權重會改變產品的控制邊界:
| 正式環境需求 | 封閉圖片 API | 開放權重模型 |
|---|---|---|
| 訓練自訂身份 adapter | 必須等待供應商提供 | 自己控制 trainer 與 target modules |
| 固定確切 base revision | 通常由供應商抽象處理 | 可記錄 model ID、revision 與檔案 |
| 載入並 A/B 多個 LoRA | 取決於供應商 | Adapter ID 與 weight 是自己的應用狀態 |
| 重現舊角色圖片 | 容易受模型暗中更新影響 | 可保留舊 base、adapter、seed 與配方 |
| 更換 GPU 供應商 | 通常要改 API | 同一套 container 與 weights 可以搬移 |
| 設定安全政策 | 供應商政策加自己的政策 | 法律、安全與產品責任完全由自己承擔 |
Z-Image 官方 repository與 model card 都以 Apache 2.0 發布;對這套流程更重要的是,未蒸餾基礎版明確支援 fine-tuning,而 Turbo 不支援。License、可下載權重與可訓練架構是三個不同檢查,不能用「open source」一句話跳過。
所以我把開放權重視為 Elyvie 長期角色層的必要條件,不是所有圖片原型的普遍規則。Mood board 或單次圖片,用封閉 API 可能更快;當身份成為長期產品資料,我需要固定、訓練、檢查、搬移與重現完整 stack 的能力。
開放權重也不代表可以省略安全。責任會更直接落到營運者身上,因此 Elyvie 仍然需要圖片權利、虛構成年人界線、權限控制、私人儲存、刪除與濫用防護。
2. 寫一頁身份設定表
永久不變的部分要短:
- 虛構成年年齡範圍;
- 臉型與膚色;
- 眼睛顏色與形狀;
- 髮色、長度、質地與標誌性髮型;
- 兩個辨識特徵;
- 基礎身形描述;
- 一個標誌性配件或顏色;
- 三個會影響表情與姿態的個性詞。
範例:
Fictional adult woman, age 28, heart-shaped face, warm olive skin, amber almond-shaped eyes, silver jaw-length bob with blunt fringe, one small beauty mark beneath the left eye, translucent raincoat, observant, composed, quietly defiant.
把內容分成三層:
| 層級 | 範例 | 規則 |
|---|---|---|
| 不變身份 | 臉型、眼型、膚色、髮線、標誌性小特徵 | 固定 |
| 受控變化 | 髮型整理、妝容、配件、服裝 | 有意識地改 |
| 單張鏡頭資訊 | 地點、姿勢、鏡頭、天氣、光線 | 不要放進身份表 |
如果把地點與光線混進身份區塊,模型可能學成「這個人永遠站在這個房間」,而不是學會這個人。
3. 先用純提示詞證明身份方向
一個可靠的順序是:
- 媒介與鏡頭類型;
- 身份區塊;
- 服裝變化;
- 動作與表情;
- 場景;
- 光線與鏡頭;
- 品質與輸出限制。
正式建立資料集前,先用乾淨光線生成正面、左四分之三與右四分之三三張中性人像。檢查:
- 眼睛顏色與距離;
- 頭髮輪廓;
- 臉型;
- 標誌性細節;
- 視覺年齡。
如果中性圖片都不穩定,電影場景不會自動修好它。先修改身份區塊,再增加複雜度。
固定 seed 只適合比較兩個提示詞版本。提示詞、模型、sampler、尺寸或 LoRA 大幅改變後,它不能保證身份不變。
4. 選身份錨點,不是只挑最好看的照片
身份錨點的工作,是清楚說明角色是誰。好的錨點應該具備:
- 畫面中只有一位清楚可見的虛構成年人;
- 眼睛銳利,臉部幾何沒有遮擋;
- 膚質自然,沒有重度美顏濾鏡;
- 視覺年齡、髮線、眼色與辨識特徵一致;
- 角度與表情有足夠差異,能表現立體身份。
排除動態模糊、極端鏡頭變形、眼睛被擋住、多張臉、互相矛盾的髮線或年齡,以及幾乎相同的裁切。
Elyvie 目前的受控流程從 4–5 張身份錨點開始,再從中確切選四張作為資料集生成參考。這足以確立身份方向,但它還不是最終訓練集。
5. 建立真正教會「變化」的資料集
訓練集必須同時回答兩個問題:
- 哪些東西必須保持不變?
- 哪些東西應該可以改變?
二十張近距離自拍只回答第一題。這種 LoRA 可能只會一個臉部角度,到了全身、動作、普通光線或新衣服就失效。
Elyvie 使用一套 20 場景資料集模板:
| 鏡頭尺度 | 場景數 | 用途 |
|---|---|---|
| 特寫 | 3 | 眼睛、臉型、髮線與小型辨識細節 |
| 半身 | 6 | 表情、姿勢、手、服裝與日常互動 |
| 全身 | 6 | 身形比例、動作、換裝與距離 |
| 環境鏡頭 | 5 | 小比例人物、混合光線與真實背景下的身份 |
場景會改變室內外地點、表情、鏡頭角度、日光、實景燈光、衣著與動作,刻意避免二十張相同棚拍。
每張候選圖都要通過:
- 恰好一張臉;
- 身份分數至少 75/100;
- 真實感分數至少 70/100;
- 安全審查通過;
- 不得和已接受圖片完全重複。
目前每個場景最多允許三次候選嘗試,正式訓練前必須有至少 15 張合格圖片,上限 20 張。這些分數是 Elyvie 的實作 gate,不是適用所有模型的科學常數。真正通用的原則是:不要讓錯誤證據進入 trainer。
6. Caption 要描述變化,trigger word 必須唯一
Caption 範例:
cylara_elyvie, fictional adult woman, waist-up, beige linen shirt, seated at an outdoor cafe, soft late-afternoon daylight, warm candid smile
Token 要獨特、可輸入,不要只用 woman、hero 或 Anna 這類常見詞。
服裝、構圖、動作、表情與場景都應寫進 caption,因為這些是未來要控制的變數。不要把暫時屬性重複寫成固定身份;如果每張 caption 都有 red dress,adapter 很可能把紅裙和人物綁在一起。
Elyvie 會以 character_slug_elyvie 形式建立穩定 trigger,並和 LoRA ID、base model 身份與訓練 manifest 一起保存。
實例:把月面觀測站圖片變成可重複使用的角色
文章封面的太空人很適合示範。第一張圖已經有清楚概念:成年天文學家、午夜藍長髮、米白與珊瑚色飛行外套、圓形月面觀測站。但它還不是可重複使用的角色,只是一張成功構圖。
假設我把她升級成 Elyvie 長期角色 Mira,我不會直接拿封面訓練,而會先寫:
mira_observatory_elyvie, fictional adult woman, age 26, oval face, large violet almond-shaped eyes, straight midnight-blue hair below the chest with a soft side fringe, small straight nose, cream flight jacket with coral hardware, curious, measured, quietly brave.
飛行外套是可控制的標誌服裝,不是永久身體特徵;觀測站是鏡頭資訊,不是身份。
A:建立四張身份錨點
| 錨點 | 構圖 | 必須證明 |
|---|---|---|
| A | 正面特寫、乾淨光線 | 眼距、臉型、瀏海與視覺年齡 |
| B | 左四分之三人像 | 鼻、臉頰、下巴與髮量 |
| C | 右四分之三人像 | 另一側臉部平面與自然不對稱 |
| D | 中性全身 | 身高感、身形比例與頭髮長度 |
如果某張錨點出現不同眼色、較短頭髮、明顯更幼的臉,或其他三張沒有的重度動漫變形,我會排除。四張彼此同意的錨點,比八張互相矛盾的圖片有用。
B:刻意打破原始構圖
訓練場景要證明 Mira 不是「圓形觀測窗裡的女人」。我會加入:
- 普通窗光下的特寫,穿深色圓領上衣;
- 書店半身鏡頭,穿針織外套並微笑;
- 海邊全身鏡頭,穿實用外套迎風走路;
- 霓虹混合光線下的夜市環境鏡頭;
- 只保留一張觀測站場景,延續原始故事世界但不支配資料集。
這就是身份訓練和重建同一張圖的差別。十九張觀測站加一張咖啡店,只會教會模型那個房間。
C:Caption 要寫變數
範例:
mira_observatory_elyvie, fictional adult woman, close portrait, dark crew-neck top, public library, soft overhead and window light, attentive expression
mira_observatory_elyvie, fictional adult woman, full-body walking pose, light windbreaker, seaside promenade, bright cloudy daylight, subtle smile
mira_observatory_elyvie, fictional adult woman, environmental frame, cream flight jacket with coral details, circular lunar observatory, cool practical light, curious expression
Trigger 保持不變;構圖、服裝、地點、光線與表情持續改變。這樣 adapter 才知道哪些要保留,哪些應繼續交給提示詞控制。
D:用資料集沒出現過的提示詞驗收
我會保留以下測試,不放進訓練集:
- Mira 穿黑色晚宴西裝,在暖色餐廳光線下大笑;
- Mira 穿紅色雨衣,以全身鏡頭穿越白天街道;
- Mira 在日落沙漠廣角畫面裡只佔很小比例;
- Mira 回到原始觀測站,表情擔心,但不穿飛行外套。
如果只有第四題成功,LoRA 學到的觀測站概念比身份更強;如果特寫通過、第三題失敗,資料集缺少尺度變化;如果晚宴西裝仍變成飛行外套,服裝綁得太死。
E:選擇最弱但合格的 adapter weight
以下是示範決策紀錄,不是通用 benchmark:
| Weight | 身份 | 真實感 | 彈性 | 決策 |
|---|---|---|---|---|
| 0.65 | 76 | 88 | 很好 | 通過,但身份剛好穩定 |
| 0.70 | 84 | 85 | 良好 | 啟用 |
| 0.75 | 90 | 78 | 開始重複服裝 | 保留作 fallback |
| 0.80 | 93 | 66 | 蠟感臉、表情僵硬 | 淘汰 |
我會啟用 0.70。最高身份分數反而落選,因為正式角色還要能演戲、換衣服並適應不同鏡頭。LoRA 是身份約束,不是命令每張圖都像訓練資料。
7. 看懂訓練控制項
不同 trainer 與模型的實際 flag 不一樣,但任何可重現的訓練紀錄都應回答:
| 控制項 | 影響內容 | 失敗訊號 |
|---|---|---|
| Base checkpoint | 接收 adapter 的視覺知識 | 無法載入,或身份混亂 |
| Rank / dimension | Adapter 容量與檔案大小 | 太低學不到身份;太高可能記住雜訊 |
| Alpha / network scale | 訓練時的有效強度 | 適應不穩或過強 |
| Learning rate | 每次更新幅度 | 太高出現 artifact;太低幾乎學不到 |
| Steps / epochs | 資料集重複多久 | 後期 checkpoint 失去彈性或複製背景 |
| Resolution 與 buckets | 模型能看到的空間細節 | 裁掉臉、拉長身體、失去全身細節 |
| Captions 與 trigger token | 身份和可控場景如何分開 | 服裝或地點與人物綁死 |
| Validation prompt 與 seed | 可比較的 checkpoint 測試 | 無法證明訓練是否進步 |
不存在「1,500 steps 永遠最好」這種誠實的通用答案。資料量、rank、target modules、caption 品質、解析度與模型架構會互相影響。應保存 checkpoints,再用固定 validation suite 比較。
如果模型受到 Hugging Face 支援,Diffusers training overview提供持續維護的 text-to-image 與 DreamBooth LoRA scripts。不要假設 SD 1.5 或 SDXL 的指令可以原封不動用在 Z-Image。
8. 啟用前一定要驗收
不要因為一張特寫好看就批准 LoRA。建立固定矩陣:
| 測試 | 保持不變 | 改變 | 通過標準 |
|---|---|---|---|
| 表情 | 身份、服裝、比例 | 平靜/大笑/堅定 | 同一個人,表情不僵死 |
| 光線 | 身份、姿勢、比例 | 窗光/霓虹/日落 | 膚色與臉部幾何保持 |
| 鏡頭 | 身份、服裝、場景 | 特寫/半身/全身 | 遠距離仍能維持身份 |
| 衣著 | 身份、臉、光線 | 休閒/正式/奇幻 | 換衣服但不換人 |
| 背景 | 身份、表情、服裝 | 家中/街道/風景 | 不洩漏訓練背景 |
比較 LoRA weights 時要使用相同 prompt 與 seed,讓 weight 成為主要變數。
Elyvie 目前會以 0.65、0.70、0.75、0.80 四種 LoRA weight 建立受控 A/B 圖組,每張使用同一組提示詞與 seed,再比較身份與真實感。當分數接近時,較低但合格的 weight 優先,因為它通常能保留更多基礎模型彈性。
正確 weight 不一定是 1.0。某個角色可能是 0.65,另一個可能要 0.80。要測試,不要猜。
9. 從失敗型態找原因
| 症狀 | 常見原因 | 下一個測試 |
|---|---|---|
| 不同場景一直換臉 | 錨點弱或互相矛盾 | 移除 outlier,重測中性人像 |
| 臉正確但每次穿同樣衣服 | Caption 或資料集把衣服和身份綁定 | 增加衣著變化並明確 caption |
| 特寫成功,全身失敗 | 缺少鏡頭尺度變化 | 增加全身與環境訓練圖 |
| 皮膚像蠟或過度修圖 | 來源有濾鏡,或 adapter 太強 | 替換美顏圖並降低 weight |
| 一直複製訓練背景 | 場景重複,或 caption 沒描述背景 | 增加地點變化並標記 |
| 表情幾乎不能改 | Overtraining 或 weight 太高 | 比較較早 checkpoint 與較低 weight |
| Adapter 無法載入 | Base family、格式、ID 或檔案錯誤 | 核對 checkpoint 相容性與 LoRA catalog |
每次只改一個變數。一次同時重做資料集、改提示詞、換 base model、提高 weight,會失去所有判斷依據。
10. Elyvie 自動處理什麼,又不處理什麼
免註冊的免費 AI 圖像生成器只做純提示詞探索,不會上傳參考圖,也不會訓練 LoRA。
Elyvie 的受控角色流程會自動處理:
- 虛構成年人與圖片權利檢查;
- 選擇 4–5 張身份錨點;
- 建立 20 個多樣場景候選;
- 身份、真實感、重複與安全審查;
- 15–20 張合格圖片的訓練 manifest;
- Z-Image 基礎版訓練;
- Validation render;
- 啟用前的四檔 weight A/B。
目前只接受虛構角色訓練集,不接受未經批准的真人複製。訓練入口和免費公開預覽是兩套不同流程。
11. 我如何租 GPU,又不讓出租機器成為唯一真相
我不需要擁有高階 GPU,才能擁有角色 pipeline。我把租來的 GPU 當成可替換算力,把真正長期的 control plane 留在 Elyvie。
邊界是:
Elyvie app → authenticated worker API → 固定版 Z-Image Base + 選定 LoRA → 私人結果儲存
Web app 管理角色紀錄、權限、job state 與最終媒體;GPU worker 處理 CUDA、模型載入、訓練與推理。更換出租機器時,公開應用 contract 不需要一起改。
怎麼選出租機器
Elyvie 目前的 Z-Image Base 與 LoRA 路徑會選 32 GB 等級 GPU,不會只看 GPU 型號。租用前要檢查:
- 對正式或敏感工作優先選 Verified 或 Secure Cloud;
- reliability 紀錄與最大租期;
- VRAM 是否能跑真正 trainer,而不只是推理;
- 磁碟是否放得下模型、套件 cache、dataset、checkpoints 與暫存檔;
- 上下行頻寬的價格,不只是 Mbps;
- SSH 與 authenticated worker 所需 ports;
- App 到 worker 的地理延遲是否合理。
Vast.ai 選機文件把 reliability 定義為歷史 uptime 與 health,也會顯示最大租期以及 GPU、storage、bandwidth 的個別價格。Verified 是有用證據,不是保證,我仍然會跑 admission test。
Vast container storage 建立後不能放大,因此磁碟要先算。我會估算完整 staged footprint,再保留約 2 倍 headroom。如果模型、cache、trainer、dataset 與 checkpoints 可能用掉 90 GB,100 GB 磁碟不是安全的 90 GB 磁碟。
前十分鐘就是 admission test
我不會先花一小時 debug,再決定機器是否合格。最低限度 preflight:
nvidia-smi
df -h /workspace
curl -fsS "$WORKER_URL/health"
curl -fsS -H "Authorization: Bearer $API_TOKEN" "$WORKER_URL/v1/loras"
curl -fsS -H "Authorization: Bearer $API_TOKEN" "$WORKER_URL/v1/training-jobs"
接著必須證明:
- 預期 GPU 與 VRAM 可見;
- 固定版 base model 顯示 ready;
- LoRA catalog 與 training endpoints 存在,而不是 HTTP 404;
- 一張普通 base-model 圖片成功;
- 一個已知 adapter 能載入並產生真實圖片;
- Adapter filename、checksum、model ID 與生成圖片已記錄。
「Container running」不等於「worker 真的能訓練」。我驗證的是應用能力,不是 marketplace 狀態。
算完整一次 run,不只看每小時貼紙價
Vast 是 marketplace,價格會變動。官方 pricing 文件說明帳單包含 compute、storage 與 bandwidth;compute 依實際使用計費,instance 存在期間 storage 仍持續收費。
公式:
預估 run 成本 = GPU 時薪 × 運行小時 + storage + bandwidth
假設某個 offer 是 每小時 $0.35:
| 階段 | 時間 |
|---|---|
| 建立與 admission test | 20 分鐘 |
| Dataset 同步與環境暖機 | 20 分鐘 |
| 訓練與 checkpoints | 70 分鐘 |
| Validation、A/B renders 與備份 | 20 分鐘 |
| 合計 | 130 分鐘 = 2.17 小時 |
Compute 約為 $0.76,還沒加 storage 與 bandwidth:2.17 × $0.35。如果 debug 拖到四小時,compute 就是 $1.40。真正洞察是:GPU 本身可能很便宜,混亂的營運流程才昂貴;吃掉兩小時注意力的廉價不穩定 host 並不便宜。
Stop、備份,再 destroy
Vast 的 stop 會保留 container data,但 storage 繼續計費;destroy 會永久移除 container storage。Storage 文件也說明 volume 能在 instance 刪除後保留,但綁定同一台實體 host。Local volume 是方便的 persistence,不是 off-site backup。
Destroy 前我會匯出:
- 最終
.safetensorsadapter 與 SHA-256 checksum; - Dataset manifest 與每張合格圖片 hash;
- Captions 與 trigger word;
- 確切 base-model ID 與 revision;
- Trainer config、套件版本與選中的 checkpoint;
- Validation prompts、seeds、score sheet 與範例輸出。
這些資料要複製到出租 host 以外的 storage。Vast 支援 Cloud Sync 與其他 data movement 方法,但真正通用的規則是:在另一台機器能重建以前,這個角色還沒有安全存在。
對敏感資料,只給最小權限與最小資料範圍。Vast 的 instance security 說明指出 community host 技術上可能存取機器內檔案;verified datacenter、加密、private object storage 與虛構訓練資料可以降低暴露。
12. 保存可重現的角色紀錄
記錄:
- 身份設定表版本;
- 確切 base model 與 revision;
- 訓練工具與 configuration;
- 合格資料集 manifest 與 captions;
- LoRA ID、adapter 檔名、trigger word 與啟用 weight;
- 圖片權利與虛構來源聲明;
- 固定 validation prompts 與 seeds;
- Checkpoint 比較、失敗紀錄與啟用決定。
資料集與 adapter 不要只留在臨時 GPU 磁碟。出租機器可能消失;真正能讓你重建角色的是模型檔、manifest、captions 與 configuration。
一套完整起步流程
- 寫身份設定表。
- 生成三張中性人像。
- 證明純提示詞身份值得繼續。
- 選 4–5 張乾淨、不重複的身份錨點。
- 建立 15–20 張多樣、有 caption 的訓練圖。
- 租一台 VRAM、磁碟 headroom、租期與 bandwidth 價格都合格的 verified GPU。
- Health、LoRA catalog、training、base render 與 adapter canary 任一不通過就拒絕該 rental。
- 針對正式環境的確切 base model 訓練。
- 用固定 validation suite 比較 checkpoints。
- 使用相同 prompt 與 seed A/B 測試不同 weights。
- 身份與彈性都通過後才啟用。
- Destroy 前備份 adapter、manifest、captions、configuration、checksums 與 validation evidence。
常見問題
角色 LoRA 需要多少張圖片?
取決於模型與資料品質。Elyvie 從 4–5 張身份錨點開始,建立 20 張多樣候選,並要求至少 15 張通過品質檢查才開始訓練。十五張多樣、清楚的圖片,比五十張近乎重複的圖片更有用。
LoRA 可以套用在任何圖片模型嗎?
不可以。LoRA 依賴訓練時的模型架構與 base checkpoint。開始前要核對確切模型家族與 loader。
固定 seed 足以保持角色一致嗎?
不足。Seed 適合受控比較,但提示詞、模型、尺寸、sampler 或 adapter 改變後,身份仍然可能變化。
LoRA weight 應該設多少?
用相同 prompt 與 seed 測試多個 weights。Elyvie 目前比較 0.65、0.70、0.75 與 0.80,再選出通過身份與真實感檢查的最低有效 weight。
Elyvie 免費圖片生成器會訓練 LoRA 嗎?
不會。免費公開生成器是純提示詞探索工具;LoRA 訓練屬於另一套受控的虛構角色流程。
我需要自己買 GPU 才能訓練角色 LoRA 嗎?
不需要。只要 worker 可重建,而且 dataset、adapter、configuration 與 validation evidence 都備份在出租機器之外,租用 GPU 就足夠。把機器當成可替換算力。
為什麼不只使用封閉圖片 API?
封閉 API 很適合早期探索。Elyvie 對長期角色使用開放權重,是因為需要固定 base revision、訓練與載入自己的 adapters、控制推理參數、更換 GPU 供應商,以及重現舊角色版本。
以上流程在 2026 年 7 月 30 日依照 Elyvie 實際 implementation 與 Z-Image、Vast.ai 官方文件核對。


