BerriAI/litellm — The fastest, litest AI Gateway. Rust core with Python SDK. Call 100+ LLM APIs in OpenAI (or native) format with cost tracking, guardrails, load balancing, and logging [Bedrock, Azure, OpenAI, Anthropic, OpenAI, VertexAI, vLLM, Nvidia NIM]
LiteLLM — 100개 이상 LLM을 통합하는 오픈소스 AI Gateway
LiteLLM은 Python SDK와 중앙 프록시를 제공해 100개 이상의 LLM 제공자를 OpenAI 호환 형식으로 호출합니다. 가상 키, 비용 추적, 가드레일, 로드 밸런싱을 갖췄으며, 프로젝트는 1,000 RPS에서 P95 지연 시간 8ms를 제시합니다.
- 주제
AI 요약
LiteLLM은 OpenAI, Anthropic, Gemini, Amazon Bedrock, Azure 등 100개 이상의 LLM 제공자를 하나의 인터페이스로 호출하는 오픈소스 AI Gateway입니다. 애플리케이션에 직접 연결하는 Python SDK와 팀 단위로 배포하는 프록시 서버를 제공합니다. 제공자마다 다른 SDK와 인증 방식, 요청 형식을 다루는 부담을 줄이는 것이 목적입니다.
SDK와 프록시 서버
Python SDK에서는 completion을 호출하고 모델 이름에 openai/ 또는 anthropic/ 같은 제공자 접두사를 붙입니다. 기존 OpenAI 클라이언트도 프록시 주소를 LiteLLM 서버로 바꾸면 사용할 수 있습니다. 프록시는 가상 키와 프로젝트별 지출 관리, 인증·권한 설정, 로깅, 가드레일, 대시보드를 중앙에서 관리합니다. SDK에는 여러 배포 환경을 대상으로 한 재시도와 대체 경로, 로드 밸런싱, 비용 추적, 관측 도구 연동 기능이 포함됩니다.
프로젝트는 벤치마크로 초당 1,000건 요청에서 P95 지연 시간 8ms를 제시합니다. 안정 릴리스용 Docker 이미지에는 12시간 부하 테스트를 거친 -stable 태그를 사용하라고 안내합니다.
지원 기능과 운영
지원 엔드포인트는 채팅 완성, Responses, 임베딩, 이미지·오디오, 배치, 재순위화 등을 포함합니다. MCP 서버의 도구를 LLM 호출에 연결하고, A2A 프로토콜로 에이전트를 등록해 호출하는 예제도 제공합니다. Claude Code, Codex, OpenCode 같은 에이전트 하네스를 LiteLLM Gateway에 연결하는 방식도 소개합니다.
운영 환경에서는 AWS와 Google Cloud용 Terraform 모듈을 제공합니다. 게이트웨이·백엔드·UI를 별도 서비스로 나누고, 관리형 PostgreSQL과 Redis, 오브젝트 스토리지를 구성합니다. 공급자 API 키는 AWS Secrets Manager나 Google Secret Manager에 보관하며, 프록시 시작 전에 데이터베이스 마이그레이션을 실행합니다. GHCR에 게시하는 Docker 이미지는 cosign으로 서명하고, 저장소는 고정된 커밋 해시의 공개 키로 서명을 검증하는 절차를 안내합니다.
Python SDK 배포판 litellm-core도 별도로 제공합니다. 이 배포판은 같은 import litellm API와 런타임 의존성을 사용하지만 CLI, 선택 기능, 대시보드는 포함하지 않습니다. 두 배포판은 Python 파일이 겹치므로 한 환경에는 litellm과 litellm-core 중 하나만 설치해야 합니다.
원문: GitHub / 번역·요약: Trawling