[미리캔버스] Machine Learning Engineer (Model Inference & Serving)
AI 자동매치가 가장 적합한 일자리를 매일 추천해드립니다
상세 정보
- 직종
- IT·개발
- 고용형태
- 정규직
- 경력
- 경력 1~3년
- 근무지
- 서울특별시 구로구 디지털로31길 12(우 08380)
- 마감일
- 모집 마감일이 공고에 적혀 있지 않습니다
- 등록일
- (18일 전)
상세 직무 내용
| 직무 소개 미리캔버스는 "디자인을 더 쉽고, 똑똑하게 완성하는 세상"을 목표로 합니다. AI 팀은 검색 임베딩 모델, 자체 LLM, 외부 LLM 연동을 포함한 다수의 AI 모델을 실제 서비스에서 운영하고 있습니다. 사용자가 검색창에 한 문장을 입력하는 순간, 여러 모델이 GPU 위에서 동시에 추론되고 그 결과가 수십 밀리초 안에 돌아와야 합니다. 이 포지션은 만들어진 모델을 프로덕션에서 가장 빠르게 돌리는 자리입니다. 모델 추론(inference) 성능을 끌어올려 사용자 경험과 비용을 동시에 개선합니다. 현재 미리캔버스의 템플릿·요소 검색, 내용 시각화, 추천 등 사용자가 매일 쓰는 기능 뒤에서 자체 모델이 동작하고 있습니다. 이 모델들이 실제 사용자에게 닿는 마지막 구간 전체를 다루게 됩니다. 미리캔버스의 모델을 수많은 사용자의 경험으로 바꾸는 일에 함께할 동료를 찾습니다. | 기대 모습 [1개월 뒤] 미리캔버스의 AI 서비스 구조와 현재 추론 아키텍처(TensorRT, vLLM, TensorRT-LLM 기반 서빙 구성)를 파악합니다. 운영 중인 모델 목록, 각 모델의 트래픽 패턴, latency 요구사항, GPU 할당 현황을 정리합니다. 온콜 및 장애 대응 프로세스에 참여하며 실제 운영 흐름을 익힙니다. [3개월 뒤] 주요 모델 중 하나를 선정해 추론 최적화를 처음부터 끝까지 수행하고, latency와 GPU 비용 개선 수치를 확인합니다. 추론 성능 지표(p99 latency, GPU 활용률, 토큰 처리량)를 상시 관측 가능한 대시보드와 알림으로 만듭니다. 서빙 요청 접수부터 배포까지의 표준 경로를 정의하고, 반복 작업을 자동화합니다. [그 이후] 각 서비스 팀이 직접 모델을 배포할 수 있는 서빙 플랫폼을 구축합니다. 모델 특성에 맞는 GPU를 선정하고 배치해 전체 추론 비용을 지속적으로 낮춥니다. 신규 추론 최적화 기술(양자화, 스펙큘레이티브 디코딩, 디스틸레이션 등)을 검증하고 서비스에 도입합니다. 팀 내 기술 전파, 문서화, 온콜 체계 정착을 통해 서빙 역량을 조직 자산으로 만듭니다. | 주요 업무 "미리디에서 이런 일들을 함께 하고 싶어요" ✅LLM 서빙 운영 및 고도화 vLLM 기반 배치 추론 및 OpenAI 호환 API 서빙을 운영합니다. TensorRT-LLM 기반으로 latency에 민감한 내부 서비스용 LLM 서빙을 구성하고 튜닝합니다. 모델 교체, 버전 롤아웃, 용량 산정, 트래픽 급증 대응을 담당합니다. ✅모델 경량화 및 추론 최적화 PyTorch 모델을 가속 프레임워크로 변환하고, 변환 전후의 정확도와 추론 속도를 측정해 검증합니다. quantization, pruning, distillation으로 모델 자체를 줄여 추론 비용과 latency를 낮춥니다. 프로파일링을 통해 실제 병목이 되는 연산을 식별하고 개선합니다. ✅추론 신뢰성 · 모니터링 p99 latency, GPU 활용률, 토큰 처리량, 큐 대기 시간 등 핵심 지표를 수집하고 대시보드화합니다. 성능 저하를 사용자 리포트 이전에 선제 탐지하는 알림 체계를 구축합니다. 서비스별 latency와 비용 요구사항에 맞춰 모델을 어떤 GPU에 올릴지 결정합니다. | 자격요건 "이런 분이라면 목표 달성에 확신을 얻을 것 같아요" 추론 최적화 프레임워크(TensorRT, TensorRT-LLM, vLLM, ONNX Runtime 등) 중 하나 이상으로 모델을 프로덕션에 서빙해본 경험이 있으신 분 GPU 추론 경험이 있고, 배치 크기 · GPU 메모리 · throughput · latency 사이의 트레이드오프를 설명할 수 있으신 분 추론에 사용되는 주요 연산(matmul, softmax/sigmoid, cumsum, attention 등)이 어디에서 병목이 되는지 이해하고 계신 분 리눅스 서버와 컨테이너 환경에서 프로세스, 메모리, 네트워크, 로그를 스스로 추적해 문제를 좁혀갈 수 있으신 분 | 우대 사항 "이런 분이라면 장기적으로 서로에게 더 긍정적일 것 같아요!" Python 웹 프레임워크(FastAPI, Django, Flask) 중 하나로 프로덕션 서비스를 개발하고 운영해본 경험이 있으신 분 모델 경량화(quantization, pruning, distillation) 및 학습 코드 작성 경험이 있으신 분 다양한 GPU(H200, A100, A10G, L40S 등) 아키텍처에서 추론 가속 경험이 있으신 분 CUDA 이해 및 프로파일링 도구(Nsight Systems, PyTorch Profiler 등) 활용 경험이 있으신 분 검색, 추천 등 대규모 실시간 트래픽 시스템의 서빙 경험이 있으신 분 | 이런 분과 함께하고 싶습니다 모델의 정확도뿐 아니라, 그 모델이 실제로 몇 ms에 얼마의 비용으로 도는지에 관심이 있는 분 추측 대신 프로파일링과 측정으로 병목을 찾는 것을 선호하는 분 장애를 개인의 실수가 아니라 시스템의 개선점으로 다루는 분 | 기타 사항 [서류 전형] - [1차 인터뷰] - [처우 협의] - [입사] 의 프로세스로 진행됩니다. 서류는 원활한 검토를 위해 PDF 형식으로 제출 부탁 드립니다. 직무/직급에 따라 2차 인터뷰가 추가될 수 있습니다. 직급에 따라 인터뷰 후 레퍼런스 체크 전형이 추가될 수 있습니다. 입사 후 3개월의 수습 기간 및 수습 평가가 진행됩니다. (급여 100%) 서류 전형 결과 안내까지는 최대 2주, 인터뷰 결과 안내까지는 최대 3주가 소요됩니다. 여러 포지션에 동시에 지원해주시는 것은 가능하지만 동일한 포지션의 경우 최종 결과 안내를 받은 시점으로부터 6개월 후에 재지원이 가능합니다.
직원을 구하고 계신가요? 돌파구는 공고 1건의 등록·3개월 노출이 무료입니다. 내 공고 올리는 방법
