# OpenAI-compatible endpoint # In Docker, use host.docker.internal instead of localhost for a model service on the host. LLM_BASE_URL=https://api.openai.com/v1/ LLM_API_KEY=sk-your-key # Default model for inline completions LLM_MODEL=gpt-4.1-mini # Pro-tier model (defaults to LLM_MODEL if unset) PRO_LLM_MODEL=gpt-4.1 # Vision model for OCR VLM_MODEL=gpt-4.1-mini # API key for the FastAPI app (change in production) API_KEY=your-secret-key-here # Browser origins allowed to send anonymous session cookies CORS_ALLOW_ORIGINS=https://imageteach.tech,https://www.imageteach.tech,http://localhost:5173,http://127.0.0.1:5173 # Anonymous session cookie SESSION_COOKIE_NAME=llm_anonymous_session SESSION_COOKIE_SECURE=true SESSION_COOKIE_SAMESITE=none SESSION_COOKIE_DOMAIN= SESSION_COOKIE_PATH=/ SESSION_COOKIE_MAX_AGE_SECONDS=2592000 SESSION_ROTATION_SECONDS=86400 # Job backend JOB_BACKEND=redis REDIS_URL=redis://localhost:6379/0 DATABASE_URL=postgresql://llm_in_text:llm_in_text_change_me@localhost:5432/llm_in_text DOCS_BACKEND=postgres JOB_REDIS_PREFIX=llmtext:jobs JOB_CONSUMER_NAME= JOB_SHARED_TEMP_DIR=/tmp/llm-in-text-jobs JOB_STATE_TTL_SECONDS=600 JOB_EVENT_TTL_SECONDS=600 JOB_EVENT_STREAM_MAXLEN=512 JOB_CANCEL_POLL_SECONDS=0.5 JOB_BUSY_NORMAL_THRESHOLD=0.25 JOB_BUSY_HIGH_THRESHOLD=0.75 JOB_BUSY_FULL_THRESHOLD=1.0 # Per-queue concurrency and capacity JOB_COMPLETION_CONCURRENCY=2 JOB_COMPLETION_MAX_QUEUE=16 JOB_PRO_COMPLETION_CONCURRENCY=1 JOB_PRO_COMPLETION_MAX_QUEUE=8 JOB_COMPRESS_CONCURRENCY=1 JOB_COMPRESS_MAX_QUEUE=8 JOB_OCR_CONCURRENCY=1 JOB_OCR_MAX_QUEUE=8 JOB_CONVERT_CONCURRENCY=1 JOB_CONVERT_MAX_QUEUE=8 JOB_TTS_CONCURRENCY=1 JOB_TTS_MAX_QUEUE=4 JOB_ASR_CONCURRENCY=1 JOB_ASR_MAX_QUEUE=4 # Timeouts (seconds) LLM_COMPLETION_TIMEOUT=600 LLM_OCR_TIMEOUT=600 # Compression limit DOC_COMPRESS_CONTEXT_LIMIT=128000 # Risk control RISK_API_WINDOW_SECONDS=60 RISK_API_SOFT_LIMIT=90 RISK_API_HARD_LIMIT=180 RISK_LLM_WINDOW_SECONDS=600 RISK_LLM_SOFT_LIMIT=8 RISK_LLM_HARD_LIMIT=16 RISK_SESSION_CONCURRENCY_LIMIT=2 RISK_GLOBAL_CONCURRENCY_LIMIT=12 RISK_DAILY_BUDGET_GLOBAL_USD=20 RISK_DAILY_BUDGET_SESSION_USD=2 RISK_DAILY_BUDGET_IP_USD=5 RISK_SINGLE_REQUEST_MAX_COST_USD=0.8 RISK_DELAY_STEP_MS=2500 RISK_DELAY_CAP_MS=30000 RISK_MODEL_CIRCUIT_FAILURES=8 RISK_MODEL_CIRCUIT_TTL_SECONDS=300 RISK_ENFORCE_REDIS_FAIL_CLOSED=false # Backend-controlled model policy RISK_COMPLETION_MODEL=gpt-4.1-mini RISK_PRO_MODEL=gpt-4.1 RISK_VISION_MODEL=gpt-4.1-mini RISK_COMPLETION_MAX_INPUT_CHARS=24000 RISK_COMPLETION_MAX_OUTPUT_TOKENS=768 RISK_COMPLETION_TEMPERATURE=0.4 RISK_PRO_MAX_INPUT_CHARS=48000 RISK_PRO_MAX_OUTPUT_TOKENS=2048 RISK_PRO_TEMPERATURE=0.6 RISK_COMPRESS_MAX_INPUT_CHARS=128000 RISK_COMPRESS_MAX_OUTPUT_TOKENS=1536 RISK_OCR_MAX_INPUT_BYTES=10485760 # Estimated pricing for budget control RISK_COMPLETION_INPUT_COST_PER_1K=0.0004 RISK_COMPLETION_OUTPUT_COST_PER_1K=0.0016 RISK_PRO_INPUT_COST_PER_1K=0.003 RISK_PRO_OUTPUT_COST_PER_1K=0.012 RISK_VISION_INPUT_COST_PER_1K=0.0008 RISK_VISION_OUTPUT_COST_PER_1K=0.0024 # Legacy fallback: if LLM_BASE_URL is not set, OLLAMA_HOST will be auto-converted to /v1/ path #OLLAMA_HOST=http://localhost:11434 # TTS/ASR settings (see README for full list) TTS_ASR_DEVICE=auto