메인 콘텐츠로 건너뛰기
W&B Inference를 사용하면 몇 가지 기본 모델과 함께 커스텀 LoRA를 사용할 수 있습니다. 이 튜토리얼에서는 TRL 라이브러리를 사용해 supervised post-training(지도 방식 사후 트레이닝)으로 파인튜닝된 LoRA를 생성하는 방법을 보여줍니다. 이 예제에서는 쿼리/Response 쌍 데이터셋을 사용해, 카우보이처럼 응답하는 모델을 파인튜닝합니다. 또한 서버리스 강화 학습을 제공하는 W&B Training을 사용해 LoRA를 생성할 수도 있습니다.

사후 트레이닝 데이터셋

다음 데이터셋에는 메시지 목록 형식의 50개 쿼리-Response 쌍이 포함되어 있습니다. 예시는 다음과 같습니다:
사용자: “What is your favorite color?”
어시스턴트: “Well, pardner, my favorite color’s the blazin’ orange of a desert sunset…”
예시 파일에는 각 줄마다 JSON 객체 하나가 들어 있습니다. 다음 데이터를 작업 디렉터리에 cowboy_examples.jsonl로 저장하세요.
cowboy_examples.jsonl

사후 트레이닝

이 스크립트는 JSONL 파일의 예시를 사용해 LoRA 어댑터를 트레이닝한 다음, W&B Inference API 또는 Playground에서 사용할 수 있도록 W&B에 아티팩트로 업로드합니다. 전체적으로 이 스크립트는 다음을 수행합니다:
  1. W&B에 로그인합니다. W&B Models의 Hugging Face Transformers 인테그레이션은 트레이닝 진행 상황과 메트릭을 자동으로 기록합니다.
  2. Hugging Face에서 기본 모델(OpenPipe/Qwen3-14B-Instruct)을 로드합니다.
  3. 파일 상단 근처에 상수로 정의된 rank와 alpha 등의 하이퍼파라미터를 사용해 LoRA를 설정합니다.
  4. 파일의 예시를 데이터셋으로 로드한 다음 SFTTrainer를 실행합니다. 기본적으로 스크립트는 모든 예시를 사용합니다.
  5. LoRA를 저장하고, W&B Inference에서 사용할 수 있도록 W&B에 Artifact로 업로드합니다.
스크립트 실행이 완료되면 브라우저에서 마지막으로 출력된 URL을 열어 저장된 Artifact를 확인하세요. 다음과 같은 형태입니다: Artifact URL: https://wandb.ai/<yourentity>/create-lora-tutorial/artifacts/lora/OpenPipe_Qwen3-14B-Instruct_cowboy/v0 다음 프로그램을 create_lora.py로 저장하고, ENTITY 값을 자신의 W&B entity로 업데이트하세요. 실행을 간소화하기 위해 이 스크립트는 의존성을 선언하는 데 inline script metadata를 사용합니다.
create_lora.py
uv를 사용해 스크립트를 실행하세요:
실행 시간은 하드웨어에 따라 달라집니다. 트레이닝 속도를 높이려면 --max-examples=10 인수를 추가할 수 있지만, 이렇게 하면 LLM이 캐릭터를 유지하며 응답하는 성능에 영향을 줄 수 있습니다.

LoRA 사용하기

새로 만든 LoRA를 W&B Weave Playground에서 바로 사용해 볼 수 있습니다. 아티팩트 URL을 열고 ‘Try in playground’ 버튼을 클릭하세요.
Artifacts UI의 LoRA
그런 다음 채팅 인터페이스 하단에 프롬프트를 입력하세요.
Playground UI의 LoRA
코드에서 새로 만든 LoRA를 사용하려면 단계별 안내가 포함된 Serverless LoRA Inference 사용 가이드를 참고하세요.

다음 step

LoRA를 생성한 후에는 다음과 같이 트레이닝을 실험해 볼 수 있습니다:
  • 더 적은 수의 예시로 LoRA를 트레이닝해도 여전히 원하는 효과가 나는지 확인해 보세요.
  • 데이터셋의 Response를 변경하여 해적이나 닌자 같은 다른 캐릭터를 보여주도록 해 보세요.