VLA 정책 배포 관제: LoRA 재학습 4 h 20 m에서 카나리 25 %·게이트 5/6까지
#VLA#CanaryDeploy#ModelLifecycle

개요

VLA 정책의 재학습→평가→카나리 배포→승격/롤백과 엣지 플릿 상태를 한 화면에서 관제하는 MLOps 콘솔 사례입니다.

프로젝트 배경 및 목적

고객사는 현장 규격이 바뀔 때마다 재학습에서 배포까지 사람이 손으로 잇느라 며칠이 걸렸고, 배포 후 성능 저하를 되돌릴 기준이 없었습니다. 이 프로젝트는 데이터셋 버전→학습 설정→체크포인트→평가→배포 버전을 해시로 묶어 추적하고, 시뮬 1,000 ep와 실기 50 ep 평가를 거친 후보만 카나리로 내보내며, 게이트 6항목을 통과해야 전량 승격하도록 했습니다. 콘솔은 고객 MLOps 팀 내부 도구이며 기록·계보 API 위에 구축됐습니다.

구성 요소

  • 3B급 양팔 VLA·LoRA r16 파인튜닝(H200 ×2, 4 h 20 m)·모델 레지스트리
  • 평가 파이프라인(시뮬 1,000 ep 94.1 %·실기 50 ep 92 %)·게이트 6항목
  • 엣지 플릿(온보드 추론 보드 INT8 38 ms)·롤백 v2.6·셀 실시간 제어기(W-RC 1 kHz)·기록·계보 API

작업순서

  1. 1파지 실패율 8 % 상승을 트리거로 텔레옵 214 ep + 합성 40k 프레임을 수집해 LoRA 재학습(4 h 20 m)
  2. 2시뮬 1,000 ep·실기 50 ep 평가를 통과한 ckpt-41200을 엣지 4대 중 1대에 카나리 배포(25 %)
  3. 324 h 관측 동안 성공률·정렬·안전정지·충돌·지연 게이트를 확인하고 통과 시 전량 승격, 미달 시 v2.6로 롤백