# OpenAI-compatible endpoint # In Docker, use host.docker.internal instead of localhost for a model service on the host. LLM_BASE_URL=https://api.openai.com/v1/ LLM_API_KEY=sk-your-key # Default model for inline completions LLM_MODEL=Nex-N2-mini-mlx-OptiQ-8bit-MTP # Pro-tier model (defaults to LLM_MODEL if unset) PRO_LLM_MODEL=Nex-N2-mini-mlx-OptiQ-8bit-MTP # Vision model for OCR VLM_MODEL=Nex-N2-mini-mlx-OptiQ-8bit-MTP # API key for the FastAPI app (change in production) API_KEY=your-secret-key-here # Browser origins allowed to send anonymous session cookies CORS_ALLOW_ORIGINS=https://imageteach.tech,https://www.imageteach.tech,http://localhost:5173,http://127.0.0.1:5173 # Anonymous session cookie SESSION_COOKIE_NAME=llm_anonymous_session SESSION_COOKIE_SECURE=true SESSION_COOKIE_SAMESITE=none SESSION_COOKIE_DOMAIN= SESSION_COOKIE_PATH=/ SESSION_COOKIE_MAX_AGE_SECONDS=2592000 SESSION_ROTATION_SECONDS=86400 # Job backend JOB_BACKEND=redis REDIS_URL=redis://localhost:6379/0 DATABASE_URL=postgresql://llm_in_text:llm_in_text_change_me@localhost:5432/llm_in_text DOCS_BACKEND=postgres JOB_REDIS_PREFIX=llmtext:jobs JOB_CONSUMER_NAME= JOB_SHARED_TEMP_DIR=/tmp/llm-in-text-jobs JOB_STATE_TTL_SECONDS=600 JOB_EVENT_TTL_SECONDS=600 JOB_EVENT_STREAM_MAXLEN=512 JOB_CANCEL_POLL_SECONDS=0.5 JOB_BUSY_NORMAL_THRESHOLD=0.25 JOB_BUSY_HIGH_THRESHOLD=0.75 JOB_BUSY_FULL_THRESHOLD=1.0 # Per-queue concurrency and capacity JOB_COMPLETION_CONCURRENCY=2 JOB_COMPLETION_MAX_QUEUE=16 JOB_PRO_COMPLETION_CONCURRENCY=1 JOB_PRO_COMPLETION_MAX_QUEUE=8 JOB_WEB_SEARCH_CONCURRENCY=1 JOB_WEB_SEARCH_MAX_QUEUE=4 JOB_COMPRESS_CONCURRENCY=1 JOB_COMPRESS_MAX_QUEUE=8 JOB_OCR_CONCURRENCY=1 JOB_OCR_MAX_QUEUE=8 JOB_CONVERT_CONCURRENCY=1 JOB_CONVERT_MAX_QUEUE=8 JOB_TTS_CONCURRENCY=4 JOB_TTS_MAX_QUEUE=16 JOB_ASR_CONCURRENCY=2 JOB_ASR_MAX_QUEUE=8 # Timeouts (seconds) LLM_COMPLETION_TIMEOUT=600 LLM_OCR_TIMEOUT=600 # Compression limit DOC_COMPRESS_CONTEXT_LIMIT=128000 # Risk control RISK_API_WINDOW_SECONDS=60 RISK_API_SOFT_LIMIT=90 RISK_API_HARD_LIMIT=180 RISK_LLM_WINDOW_SECONDS=600 RISK_LLM_SOFT_LIMIT=8 RISK_LLM_HARD_LIMIT=16 RISK_SESSION_CONCURRENCY_LIMIT=2 RISK_GLOBAL_CONCURRENCY_LIMIT=12 RISK_DAILY_BUDGET_GLOBAL_USD=20 RISK_DAILY_BUDGET_SESSION_USD=2 RISK_DAILY_BUDGET_IP_USD=5 RISK_SINGLE_REQUEST_MAX_COST_USD=0.8 RISK_DELAY_STEP_MS=2500 RISK_DELAY_CAP_MS=30000 RISK_MODEL_CIRCUIT_FAILURES=8 RISK_MODEL_CIRCUIT_TTL_SECONDS=300 RISK_ENFORCE_REDIS_FAIL_CLOSED=false # Backend-controlled model policy RISK_COMPLETION_MODEL=Nex-N2-mini-mlx-OptiQ-8bit-MTP RISK_PRO_MODEL=Nex-N2-mini-mlx-OptiQ-8bit-MTP RISK_VISION_MODEL=Nex-N2-mini-mlx-OptiQ-8bit-MTP RISK_WEB_SEARCH_MODEL=Nex-N2-mini-mlx-OptiQ-8bit-MTP RISK_SPEECH_TTS_MODEL=Qwen3-TTS-12Hz-1.7B-VoiceDesign-8bit RISK_SPEECH_ASR_MODEL=Qwen3-ASR-0.6B-8bit RISK_COMPLETION_MAX_INPUT_CHARS=24000 RISK_COMPLETION_MAX_OUTPUT_TOKENS=768 RISK_COMPLETION_TEMPERATURE=0.4 RISK_PRO_MAX_INPUT_CHARS=48000 RISK_PRO_MAX_OUTPUT_TOKENS=2048 RISK_PRO_TEMPERATURE=0.6 RISK_WEB_SEARCH_MAX_INPUT_CHARS=128000 RISK_WEB_SEARCH_MAX_OUTPUT_TOKENS=4096 RISK_WEB_SEARCH_TEMPERATURE=0.4 RISK_COMPRESS_MAX_INPUT_CHARS=128000 RISK_COMPRESS_MAX_OUTPUT_TOKENS=1536 RISK_OCR_MAX_INPUT_BYTES=104857600 RISK_SPEECH_TTS_MAX_INPUT_CHARS=4096 RISK_SPEECH_ASR_MAX_INPUT_BYTES=104857600 # Web search providers SEARXNG_BASE_URL=http://searxng:8080 SEARXNG_RESULT_LIMIT=10 FIRECRAWL_BASE_URL=http://firecrawl:3002 FIRECRAWL_API_KEY=change-me WEB_SEARCH_QUERY_COUNT=4 WEB_SEARCH_SELECTED_URL_LIMIT=10 # Estimated pricing for budget control RISK_COMPLETION_INPUT_COST_PER_1K=0.0004 RISK_COMPLETION_OUTPUT_COST_PER_1K=0.0016 RISK_PRO_INPUT_COST_PER_1K=0.003 RISK_PRO_OUTPUT_COST_PER_1K=0.012 RISK_VISION_INPUT_COST_PER_1K=0.0008 RISK_VISION_OUTPUT_COST_PER_1K=0.0024 RISK_SPEECH_TTS_INPUT_COST_PER_1K_CHARS=0 RISK_SPEECH_TTS_OUTPUT_COST_PER_MINUTE_AUDIO=0 RISK_SPEECH_ASR_INPUT_COST_PER_MB=0 # Shared speech API settings (uses LLM_BASE_URL + LLM_API_KEY) TTS_MODEL_ID=Qwen3-TTS-12Hz-1.7B-VoiceDesign-8bit TTS_DEFAULT_INSTRUCTIONS=A clear, natural voice speaking Mandarin Chinese. ASR_MODEL_ID=Qwen3-ASR-0.6B-8bit TTS_ASR_MAX_TEXT_CHARS=4096 ASR_MAX_AUDIO_BYTES=104857600 TTS_ASR_TTS_TIMEOUT_SECONDS=180 TTS_ASR_ASR_TIMEOUT_SECONDS=300 TTS_ASR_HEALTHCHECK_TIMEOUT_SECONDS=5 TTS_ASR_MAX_CONNECTIONS=24 TTS_ASR_MAX_KEEPALIVE_CONNECTIONS=12