MONITOR
GPU & 작업 현황
-
LLM 서빙
-
연구 작업
-
대기 중
-
실행 중
Tier 별 큐 현황
로딩 중...
전역 대기 큐
로딩 중...
연구실 공정 사용량 (Fair-share)
최근 연구 작업
로딩 중...
모델 현황
로딩 중...
GPU 상세
SUBMIT
작업 제출
RESULTS
결과물
완료된 작업이 없습니다.
MY JOBS
내 작업 목록
로딩 중...
WORKSPACE
내 워크스페이스
로딩 중...
LLM API
API 키 관리
로딩 중...
USAGE
사용량
로딩 중...
EXAMPLE
사용 예시
curl -X POST /v1/llm/chat/completions \
-H "Authorization: Bearer sk-YOUR_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "your-model-name",
"messages": [{"role": "user", "content": "Hello!"}]
}'
OpenAI SDK 호환: base_url을 /v1/llm으로 설정하세요.
GUIDE
아티팩트 작성 가이드
zip 구조
코드를 zip 파일 루트에 바로 넣으세요. 감싸는 폴더 없이 main.py가 최상위에 위치해야 합니다.
my-train.zip ├── main.py ← 엔트리포인트 ├── model.py ├── utils/ │ └── data.py └── requirements.txt
만드는 법:
cd my-project && zip -r ../my-train.zip .
실행 명령
비워두면 python main.py가 기본 실행됩니다.
다른 엔트리포인트가 필요한 경우에만 직접 입력하세요.
| 명령 예시 | 설명 |
|---|---|
| (비워두기) | 기본값: python main.py |
bash run.sh | 쉘 스크립트 실행 |
python train.py | zip 안에 train.py 필요 |
환경 변수
시스템이 자동으로 주입하는 변수를 코드에서 사용할 수 있습니다.
| 변수 | 용도 |
|---|---|
JOB_OUTPUT_DIR | 결과물 저장 경로 |
JOB_SCRATCH_DIR | 임시 파일 경로 |
JOB_INPUT_PATH | 공유 입력 데이터 경로 |
JOB_ID | 작업 고유 ID |
JOB_ATTEMPT | 현재 시도 번호 |
제약 사항
- zip 크기: 최대 500 MB
- 압축 해제 후: 최대 10 GB
- 파일 수: 최대 10,000 개
- GPU: 기본 1장, 최대 8장 (tier별 상한)
- 제한 시간: 60초 ~ 72시간
코드 예시
JOB_OUTPUT_DIR에 결과를 저장하면 실행 후에도 보존됩니다.
import os, json
from pathlib import Path
output_dir = Path(os.getenv("JOB_OUTPUT_DIR", "."))
output_dir.mkdir(parents=True, exist_ok=True)
# ... 학습 코드 ...
# 결과 저장
torch.save(model.state_dict(), output_dir / "model.pt")
(output_dir / "metrics.json").write_text(json.dumps(history))
네트워크 정책
- 환경 빌드 시: pip install 등 외부 네트워크 사용 가능
- 작업 실행 시: 외부 네트워크 차단 (보안 격리)
- 필요한 패키지는 워크스페이스에서 미리 설치하세요
- 학습 데이터는
/data/shared에 사전 배치 - 사전학습 모델(YOLO 등)이 필요하면 관리자에게 문의하세요 (jedutools@gmail.com)
실행 흐름
zip 업로드
검증
GPU 자동 배정
zip 해제 → 명령 실행
완료 또는 OOM 시 더 큰 GPU에서 재시도
LAB MANAGEMENT
연구실 관리
MY INFO
내 정보
ADMIN