Files
anyllm-proxy/assets/model_pricing.json
T
whit3rabbitandClaude Opus 4.6 d6b9d61071 feat: add caching, batch API, cost tracking, budget/RBAC, audio/image passthrough
LiteLLM parity features:
- Response caching (in-memory moka, optional Redis tier) with per-request TTL
- Batch API (file upload, job creation/listing via OpenAI delegation)
- Per-key budget enforcement (daily/monthly/lifetime) with lazy period reset
- RBAC (admin/developer key roles, developer keys blocked from /admin/)
- Audio transcription/speech and image generation passthrough
- Fallback chain config (YAML-based, 5xx/429 failover)
- Cost tracking foundation (model pricing DB, per-key spend queries)

Code quality cleanup (simplify pass):
- Extract try_cache_response helper (was copy-pasted 4x)
- Extract common_routes for batch/models (was duplicated across 3 HandlerMode arms)
- Deduplicate embeddings_passthrough to delegate to raw_passthrough
- Remove dead code: inject_cost_header, BudgetDuration::from_str_lossy, duplicate CacheConfig
- Collapse epoch_to_ymd wrapper into pub(crate) days_to_ymd

Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>
2026-03-26 20:23:38 -05:00

26 lines
2.9 KiB
JSON

[
{"model_pattern": "gpt-4o", "input_cost_per_token": 0.0000025, "output_cost_per_token": 0.00001, "provider": "openai"},
{"model_pattern": "gpt-4o-mini", "input_cost_per_token": 0.00000015, "output_cost_per_token": 0.0000006, "provider": "openai"},
{"model_pattern": "gpt-4-turbo", "input_cost_per_token": 0.00001, "output_cost_per_token": 0.00003, "provider": "openai"},
{"model_pattern": "gpt-4", "input_cost_per_token": 0.00003, "output_cost_per_token": 0.00006, "provider": "openai"},
{"model_pattern": "gpt-3.5-turbo", "input_cost_per_token": 0.0000005, "output_cost_per_token": 0.0000015, "provider": "openai"},
{"model_pattern": "o1", "input_cost_per_token": 0.000015, "output_cost_per_token": 0.00006, "provider": "openai"},
{"model_pattern": "o1-mini", "input_cost_per_token": 0.000003, "output_cost_per_token": 0.000012, "provider": "openai"},
{"model_pattern": "o3-mini", "input_cost_per_token": 0.0000011, "output_cost_per_token": 0.0000044, "provider": "openai"},
{"model_pattern": "claude-opus-4-6", "input_cost_per_token": 0.000015, "output_cost_per_token": 0.000075, "provider": "anthropic"},
{"model_pattern": "claude-sonnet-4-6", "input_cost_per_token": 0.000003, "output_cost_per_token": 0.000015, "provider": "anthropic"},
{"model_pattern": "claude-3-5-sonnet", "input_cost_per_token": 0.000003, "output_cost_per_token": 0.000015, "provider": "anthropic"},
{"model_pattern": "claude-3-5-haiku", "input_cost_per_token": 0.0000008, "output_cost_per_token": 0.000004, "provider": "anthropic"},
{"model_pattern": "claude-3-opus", "input_cost_per_token": 0.000015, "output_cost_per_token": 0.000075, "provider": "anthropic"},
{"model_pattern": "claude-3-sonnet", "input_cost_per_token": 0.000003, "output_cost_per_token": 0.000015, "provider": "anthropic"},
{"model_pattern": "claude-3-haiku", "input_cost_per_token": 0.00000025, "output_cost_per_token": 0.00000125, "provider": "anthropic"},
{"model_pattern": "gemini-2.5-pro", "input_cost_per_token": 0.00000125, "output_cost_per_token": 0.00001, "provider": "google"},
{"model_pattern": "gemini-2.5-flash", "input_cost_per_token": 0.00000015, "output_cost_per_token": 0.0000006, "provider": "google"},
{"model_pattern": "gemini-2.0-flash", "input_cost_per_token": 0.0000001, "output_cost_per_token": 0.0000004, "provider": "google"},
{"model_pattern": "gemini-1.5-pro", "input_cost_per_token": 0.00000125, "output_cost_per_token": 0.000005, "provider": "google"},
{"model_pattern": "gemini-1.5-flash", "input_cost_per_token": 0.000000075, "output_cost_per_token": 0.0000003, "provider": "google"},
{"model_pattern": "text-embedding-3-large", "input_cost_per_token": 0.00000013, "output_cost_per_token": 0.0, "provider": "openai"},
{"model_pattern": "text-embedding-3-small", "input_cost_per_token": 0.00000002, "output_cost_per_token": 0.0, "provider": "openai"},
{"model_pattern": "text-embedding-ada-002", "input_cost_per_token": 0.0000001, "output_cost_per_token": 0.0, "provider": "openai"}
]