시리즈 · 총 4편

AI Gateway 운영기

LLM 트래픽을 다루는 게이트웨이 — LiteLLM으로 여러 LLM을 통합하는 것부터 개인 인프라 구축, Gateway API 프록시 선택, 그리고 스트리밍 응답의 내부 동작까지

  1. 1.

    LiteLLM으로 개인 인프라부터 엔터프라이즈까지 LLM API 통합하기

    100개 이상의 LLM을 단일 OpenAI 형식으로 통합하는 LiteLLM. SDK와 Proxy Server의 차이, 실제 운영 경험, 도입 판단 기준을 공유합니다.

  2. 2.

    LiteLLM Gateway 개인 인프라 구성 - Claude 대체 Gemini Fallback

    Claude 구독 만료 대비 LiteLLM Proxy 기반 LLM fallback 인프라를 K3s + Cloudflare Tunnel로 구성한 과정을 정리합니다.

  3. 3.

    ingress-nginx가 EOL인데 뭘로 갈아타야 하는가

    ingress-nginx EOL 이후 Gateway API 구현체 비교: Envoy Gateway, Istio, NGINX Gateway Fabric, Cilium의 성능과 특성, 그리고 환경별 전환 판단 기준

  4. 4.

    AI 게이트웨이에서 버퍼링을 꺼야 하는 이유

    ChatGPT처럼 한 글자씩 도착하는 응답의 뒤에는 Streamable HTTP가 있다. HTTP/1.1 chunked와 HTTP/2 DATA frame의 차이, LLM 토큰 스트리밍에서 버퍼링을 꺼야 하는 이유와 그 메모리 대가, 그리고 Envoy Gateway와 APISIX 선택 기준까지.