AI 게이트웨이는 왜 버퍼링을 꺼야 하는가 — 스트리밍 응답의 내부
ChatGPT처럼 한 글자씩 도착하는 응답의 뒤에는 Streamable HTTP가 있다. HTTP/1.1 chunked와 HTTP/2 DATA frame의 차이, LLM 토큰 스트리밍에서 버퍼링을 꺼야 하는 이유와 그 메모리 대가, 그리고 Envoy Gateway·APISIX 선택 기준까지.
ai llm gateway envoy apisix streaming sse http2 kubernetes devops