AI·ML 엔지니어링
Kueue 갱 스케줄링 장애 회고: 유휴 GPU의 역설
쿼터는 충분한데 GPU는 비어 있었다. Kueue의 gang scheduling과 cohort borrowing이 충돌한 사례를 뜯어본 장애 회고.
배승현
쿼터는 충분한데 GPU는 비어 있었다. Kueue의 gang scheduling과 cohort borrowing이 충돌한 사례를 뜯어본 장애 회고.
HNSW ef_search 튜닝의 재현율-지연 트레이드오프를 실측치로 뜯어보고, pgvector와 전용 벡터DB의 규모별 경계를 정리한다.
vLLM 연속 배칭 처리량 병목을 KV 캐시·스케줄러·prefix 라우팅 계층별로 뜯어보고 실측 수치로 검증한다.
MIG와 타임슬라이싱의 GPU 배분 구조를 실측치로 뜯어본다. 2025 A100 벤치마크와 2026 워크로드 연구 기반 비교.
IVFFlat 인덱스에서 재현율이 떨어진 사례를 되짚으며 pgvector HNSW·IVFFlat 선택 기준을 실측치로 정리한다.
긴 프롬프트에서 프리픽스 캐시가 깨지는 지점을 짚고, 전체 캐싱과 경계 분리 전략의 비용·지연 실측치를 대조한다.
다중 팀이 GPU를 공유할 때 겪는 스케줄링·격리·활용률 상충을 정의하고, 분할 방식부터 선점 정책, 분산 조율까지 설계 판단축을 체계적으로 정리합니다.
RAG 파이프라인에서 검색 품질을 좌우하는 청킹·임베딩·인덱스 선택. 재현율과 응답 속도, 인프라 비용을 동시에 고려하는 설계 원칙과 실측 기준.
프로덕션 LLM 추론의 핵심은 KV 캐시 관리와 배칭 전략. GPU 메모리 압박 속에서 처리량 최대화와 응답 시간 사이의 선택지를 체계적으로 분석한다.