feat: sync full-stack Docker runtime and UI
This commit is contained in:
+29
-16
@@ -4,13 +4,13 @@ LLM_BASE_URL=https://api.openai.com/v1/
|
||||
LLM_API_KEY=sk-your-key
|
||||
|
||||
# Default model for inline completions
|
||||
LLM_MODEL=gpt-4.1-mini
|
||||
LLM_MODEL=Nex-N2-mini-mlx-OptiQ-8bit-MTP
|
||||
|
||||
# Pro-tier model (defaults to LLM_MODEL if unset)
|
||||
PRO_LLM_MODEL=gpt-4.1
|
||||
PRO_LLM_MODEL=Nex-N2-mini-mlx-OptiQ-8bit-MTP
|
||||
|
||||
# Vision model for OCR
|
||||
VLM_MODEL=gpt-4.1-mini
|
||||
VLM_MODEL=Nex-N2-mini-mlx-OptiQ-8bit-MTP
|
||||
|
||||
# API key for the FastAPI app (change in production)
|
||||
API_KEY=your-secret-key-here
|
||||
@@ -56,10 +56,10 @@ JOB_OCR_CONCURRENCY=1
|
||||
JOB_OCR_MAX_QUEUE=8
|
||||
JOB_CONVERT_CONCURRENCY=1
|
||||
JOB_CONVERT_MAX_QUEUE=8
|
||||
JOB_TTS_CONCURRENCY=1
|
||||
JOB_TTS_MAX_QUEUE=4
|
||||
JOB_ASR_CONCURRENCY=1
|
||||
JOB_ASR_MAX_QUEUE=4
|
||||
JOB_TTS_CONCURRENCY=4
|
||||
JOB_TTS_MAX_QUEUE=16
|
||||
JOB_ASR_CONCURRENCY=2
|
||||
JOB_ASR_MAX_QUEUE=8
|
||||
|
||||
# Timeouts (seconds)
|
||||
LLM_COMPLETION_TIMEOUT=600
|
||||
@@ -88,10 +88,12 @@ RISK_MODEL_CIRCUIT_TTL_SECONDS=300
|
||||
RISK_ENFORCE_REDIS_FAIL_CLOSED=false
|
||||
|
||||
# Backend-controlled model policy
|
||||
RISK_COMPLETION_MODEL=gpt-4.1-mini
|
||||
RISK_PRO_MODEL=gpt-4.1
|
||||
RISK_VISION_MODEL=gpt-4.1-mini
|
||||
RISK_WEB_SEARCH_MODEL=gpt-4.1-mini
|
||||
RISK_COMPLETION_MODEL=Nex-N2-mini-mlx-OptiQ-8bit-MTP
|
||||
RISK_PRO_MODEL=Nex-N2-mini-mlx-OptiQ-8bit-MTP
|
||||
RISK_VISION_MODEL=Nex-N2-mini-mlx-OptiQ-8bit-MTP
|
||||
RISK_WEB_SEARCH_MODEL=Nex-N2-mini-mlx-OptiQ-8bit-MTP
|
||||
RISK_SPEECH_TTS_MODEL=Qwen3-TTS-12Hz-1.7B-VoiceDesign-8bit
|
||||
RISK_SPEECH_ASR_MODEL=Qwen3-ASR-0.6B-8bit
|
||||
RISK_COMPLETION_MAX_INPUT_CHARS=24000
|
||||
RISK_COMPLETION_MAX_OUTPUT_TOKENS=768
|
||||
RISK_COMPLETION_TEMPERATURE=0.4
|
||||
@@ -104,6 +106,8 @@ RISK_WEB_SEARCH_TEMPERATURE=0.4
|
||||
RISK_COMPRESS_MAX_INPUT_CHARS=128000
|
||||
RISK_COMPRESS_MAX_OUTPUT_TOKENS=1536
|
||||
RISK_OCR_MAX_INPUT_BYTES=104857600
|
||||
RISK_SPEECH_TTS_MAX_INPUT_CHARS=4096
|
||||
RISK_SPEECH_ASR_MAX_INPUT_BYTES=104857600
|
||||
|
||||
# Web search providers
|
||||
SEARXNG_BASE_URL=http://searxng:8080
|
||||
@@ -120,9 +124,18 @@ RISK_PRO_INPUT_COST_PER_1K=0.003
|
||||
RISK_PRO_OUTPUT_COST_PER_1K=0.012
|
||||
RISK_VISION_INPUT_COST_PER_1K=0.0008
|
||||
RISK_VISION_OUTPUT_COST_PER_1K=0.0024
|
||||
RISK_SPEECH_TTS_INPUT_COST_PER_1K_CHARS=0
|
||||
RISK_SPEECH_TTS_OUTPUT_COST_PER_MINUTE_AUDIO=0
|
||||
RISK_SPEECH_ASR_INPUT_COST_PER_MB=0
|
||||
|
||||
# Legacy fallback: if LLM_BASE_URL is not set, OLLAMA_HOST will be auto-converted to /v1/ path
|
||||
#OLLAMA_HOST=http://localhost:11434
|
||||
|
||||
# TTS/ASR settings (see README for full list)
|
||||
TTS_ASR_DEVICE=auto
|
||||
# Shared speech API settings (uses LLM_BASE_URL + LLM_API_KEY)
|
||||
TTS_MODEL_ID=Qwen3-TTS-12Hz-1.7B-VoiceDesign-8bit
|
||||
TTS_DEFAULT_INSTRUCTIONS=A clear, natural voice speaking Mandarin Chinese.
|
||||
ASR_MODEL_ID=Qwen3-ASR-0.6B-8bit
|
||||
TTS_ASR_MAX_TEXT_CHARS=4096
|
||||
ASR_MAX_AUDIO_BYTES=104857600
|
||||
TTS_ASR_TTS_TIMEOUT_SECONDS=180
|
||||
TTS_ASR_ASR_TIMEOUT_SECONDS=300
|
||||
TTS_ASR_HEALTHCHECK_TIMEOUT_SECONDS=5
|
||||
TTS_ASR_MAX_CONNECTIONS=24
|
||||
TTS_ASR_MAX_KEEPALIVE_CONNECTIONS=12
|
||||
|
||||
Reference in New Issue
Block a user