Na Group Server Monitoring System
← 대시보드

사용 설명서

랩 GPU 서버(DGX H200, Blackwell)의 실시간 현황 확인 + 예약 + 자동 예약 해제 시스템입니다. 구글 시트 예약의 문제(작업이 끝나도 예약이 안 빠짐)를 해결하기 위해, 시스템이 GPU의 실제 사용을 직접 관측해서 안 쓰는 예약을 자동으로 회수합니다.

1. 화면 읽는 법

표시의미
사용 가능예약도 없고 작업도 없음 — 바로 예약해서 쓰면 됩니다
사용 중예약자가 실제로 작업을 돌리는 중
예약됨 · 유휴예약은 있는데 GPU가 놀고 있음 — 곧 자동 해제 대상이 될 수 있음
예약 없이 사용 중예약 없이 작업이 돌아가는 중 — 예약 후 사용해 주세요 (경고 알림 발생)

서버 헤더에는 CPU·RAM·디스크 사용량과, 로그인 시 실행 중인 도커 컨테이너 목록(소유자·자원 사용량)이 보입니다. 카드의 그래프는 최근 3시간 GPU 사용률입니다.

2. 로그인

  1. 랩 Slack에서 /gpu login 입력
  2. 봇이 DM으로 보내주는 1회용 링크(10분 유효) 클릭 → 로그인 버튼

별도 비밀번호가 없습니다 — 랩 Slack 멤버라는 것 자체가 로그인 자격입니다.

3. 예약하기

4. 연장 · 해제

5. 자동 해제 (제일 중요)

예약했는데 GPU를 안 쓰면 (프로세스 없음 + 사용률 5% 미만):

유휴 시간일어나는 일
30분Slack DM 경고 + [계속 사용 +60분] [지금 해제] 버튼
50분최종 경고 (10분 후 해제 예고)
60분예약 자동 해제 (증거 그래프 + [다시 예약] 버튼 포함 DM)

6. 계정 연동 (꼭 해주세요)

Slack에서 /gpu link → 봇이 알려주는 touch /tmp/gpuboard-코드 명령을 아무 GPU 서버에서 본인 계정으로 실행하면 연동 완료. 이걸 해야 시스템이 "예약자 본인이 쓰는 중"인지 판별할 수 있습니다 — 안 하면 본인 작업도 "예약자 외 사용" 경고가 뜰 수 있어요. 도커를 쓰는 경우 컨테이너의 마운트 경로(/raid/계정명/…)로 소유자를 추정하므로, 본인 계정 경로를 마운트해서 쓰면 됩니다.

7. 알림 (대시보드 상단 배너 · #server 채널)

시스템이 문제를 감지하면 누구 문제인지 계정·컨테이너 이름과 함께 알려줍니다 — 단, 알려만 주고 작업에 개입하지는 않습니다. 본인 이름이 뜬 항목은 직접 조치해 주세요.

매일 오전 9시 #server 채널에 요약이 올라옵니다: 사용 가능 현황, 현재/오늘 예약, 조치 필요 항목.

8. Slack 명령어 모음

명령동작
/gpu전체 현황 + 빈 GPU 예약 버튼
/gpu claim dgx:0 1d예약 (여러 장: dgx:0,1)
/gpu extend 1d연장 (3회 초과 시: /gpu extend 1d 특수코드)
/gpu release해제
/gpu watch dgx:0비면 DM (unwatch 취소)
/gpu link리눅스 계정 연동
/gpu login웹 로그인 링크 받기

9. 자주 묻는 질문

Q. "섀도 모드"가 뭔가요?
도입 초기 시운전 상태입니다. 자동 해제 조건이 충족돼도 실제로 해제하지 않고 "해제될 뻔했다" 알림만 보내며 임계값을 조정합니다. 안정화되면 관리자가 끄고 실제 자동 해제가 시작됩니다.

Q. 급하게 GPU가 대량으로 필요하면?
관리자(서버마스터)에게 요청하세요. 관리자는 긴급 선점으로 일괄 확보할 수 있고, 이 경우 기존 예약은 삭제되지 않고 가장 빠른 다음 시간대로 자동 이동되며 당사자에게 DM이 갑니다.

Q. 내 작업이 자동 해제로 죽나요?
아니요. 어떤 경우에도 프로세스는 건드리지 않습니다. 예약 기록만 해제되며, 잘못 해제됐다면 DM의 [다시 예약] 버튼 한 번으로 복구됩니다.

Q. GPU에 administrator(Xorg)가 보이던데?
서버 화면 출력용 시스템 프로세스입니다. 자원을 거의 안 쓰고 판정에도 영향이 없어 목록에서 숨겼습니다.

문의: 관리자(서버마스터) · 시스템 문제는 #server 채널에