mirror of
https://github.com/whit3rabbit/anyllm-proxy.git
synced 2026-09-22 00:00:50 +00:00
LiteLLM parity features: - Response caching (in-memory moka, optional Redis tier) with per-request TTL - Batch API (file upload, job creation/listing via OpenAI delegation) - Per-key budget enforcement (daily/monthly/lifetime) with lazy period reset - RBAC (admin/developer key roles, developer keys blocked from /admin/) - Audio transcription/speech and image generation passthrough - Fallback chain config (YAML-based, 5xx/429 failover) - Cost tracking foundation (model pricing DB, per-key spend queries) Code quality cleanup (simplify pass): - Extract try_cache_response helper (was copy-pasted 4x) - Extract common_routes for batch/models (was duplicated across 3 HandlerMode arms) - Deduplicate embeddings_passthrough to delegate to raw_passthrough - Remove dead code: inject_cost_header, BudgetDuration::from_str_lossy, duplicate CacheConfig - Collapse epoch_to_ymd wrapper into pub(crate) days_to_ymd Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>
26 lines
2.9 KiB
JSON
26 lines
2.9 KiB
JSON
[
|
|
{"model_pattern": "gpt-4o", "input_cost_per_token": 0.0000025, "output_cost_per_token": 0.00001, "provider": "openai"},
|
|
{"model_pattern": "gpt-4o-mini", "input_cost_per_token": 0.00000015, "output_cost_per_token": 0.0000006, "provider": "openai"},
|
|
{"model_pattern": "gpt-4-turbo", "input_cost_per_token": 0.00001, "output_cost_per_token": 0.00003, "provider": "openai"},
|
|
{"model_pattern": "gpt-4", "input_cost_per_token": 0.00003, "output_cost_per_token": 0.00006, "provider": "openai"},
|
|
{"model_pattern": "gpt-3.5-turbo", "input_cost_per_token": 0.0000005, "output_cost_per_token": 0.0000015, "provider": "openai"},
|
|
{"model_pattern": "o1", "input_cost_per_token": 0.000015, "output_cost_per_token": 0.00006, "provider": "openai"},
|
|
{"model_pattern": "o1-mini", "input_cost_per_token": 0.000003, "output_cost_per_token": 0.000012, "provider": "openai"},
|
|
{"model_pattern": "o3-mini", "input_cost_per_token": 0.0000011, "output_cost_per_token": 0.0000044, "provider": "openai"},
|
|
{"model_pattern": "claude-opus-4-6", "input_cost_per_token": 0.000015, "output_cost_per_token": 0.000075, "provider": "anthropic"},
|
|
{"model_pattern": "claude-sonnet-4-6", "input_cost_per_token": 0.000003, "output_cost_per_token": 0.000015, "provider": "anthropic"},
|
|
{"model_pattern": "claude-3-5-sonnet", "input_cost_per_token": 0.000003, "output_cost_per_token": 0.000015, "provider": "anthropic"},
|
|
{"model_pattern": "claude-3-5-haiku", "input_cost_per_token": 0.0000008, "output_cost_per_token": 0.000004, "provider": "anthropic"},
|
|
{"model_pattern": "claude-3-opus", "input_cost_per_token": 0.000015, "output_cost_per_token": 0.000075, "provider": "anthropic"},
|
|
{"model_pattern": "claude-3-sonnet", "input_cost_per_token": 0.000003, "output_cost_per_token": 0.000015, "provider": "anthropic"},
|
|
{"model_pattern": "claude-3-haiku", "input_cost_per_token": 0.00000025, "output_cost_per_token": 0.00000125, "provider": "anthropic"},
|
|
{"model_pattern": "gemini-2.5-pro", "input_cost_per_token": 0.00000125, "output_cost_per_token": 0.00001, "provider": "google"},
|
|
{"model_pattern": "gemini-2.5-flash", "input_cost_per_token": 0.00000015, "output_cost_per_token": 0.0000006, "provider": "google"},
|
|
{"model_pattern": "gemini-2.0-flash", "input_cost_per_token": 0.0000001, "output_cost_per_token": 0.0000004, "provider": "google"},
|
|
{"model_pattern": "gemini-1.5-pro", "input_cost_per_token": 0.00000125, "output_cost_per_token": 0.000005, "provider": "google"},
|
|
{"model_pattern": "gemini-1.5-flash", "input_cost_per_token": 0.000000075, "output_cost_per_token": 0.0000003, "provider": "google"},
|
|
{"model_pattern": "text-embedding-3-large", "input_cost_per_token": 0.00000013, "output_cost_per_token": 0.0, "provider": "openai"},
|
|
{"model_pattern": "text-embedding-3-small", "input_cost_per_token": 0.00000002, "output_cost_per_token": 0.0, "provider": "openai"},
|
|
{"model_pattern": "text-embedding-ada-002", "input_cost_per_token": 0.0000001, "output_cost_per_token": 0.0, "provider": "openai"}
|
|
]
|