시리즈 · 총 4편
AI Gateway 운영기
LLM 트래픽을 다루는 게이트웨이 — LiteLLM으로 여러 LLM을 통합하는 것부터 개인 인프라 구축, Gateway API 프록시 선택, 그리고 스트리밍 응답의 내부 동작까지
- 1.
LiteLLM으로 LLM API 통합하기 — 개인 인프라에서 엔터프라이즈까지
100개 이상의 LLM을 단일 OpenAI 형식으로 통합하는 LiteLLM. SDK와 Proxy Server의 차이, 실제 운영 경험, 도입 판단 기준을 공유합니다.
- 2.
LiteLLM Gateway 개인 인프라 구성 - Claude 대체 Gemini Fallback
Claude 구독 만료 대비 LiteLLM Proxy 기반 LLM fallback 인프라를 K3s + Cloudflare Tunnel로 구성한 과정을 정리합니다.
- 3.
ingress-nginx가 EOL인데 뭘로 갈아타야 하는가
ingress-nginx EOL 이후 Gateway API 구현체 비교 — Envoy Gateway, Istio, NGINX Gateway Fabric, Cilium의 성능과 특성, 그리고 환경별 전환 판단 기준
- 4.
AI 게이트웨이는 왜 버퍼링을 꺼야 하는가 — 스트리밍 응답의 내부
ChatGPT처럼 한 글자씩 도착하는 응답의 뒤에는 Streamable HTTP가 있다. HTTP/1.1 chunked와 HTTP/2 DATA frame의 차이, LLM 토큰 스트리밍에서 버퍼링을 꺼야 하는 이유와 그 메모리 대가, 그리고 Envoy Gateway·APISIX 선택 기준까지.