fix(nvidia): revert to nemotron-mini, truncate context for 4K limit, enforce precise confidence
All checks were successful
E2E Health Check / e2e-health (push) Successful in 17s

This commit is contained in:
OG T
2026-03-31 13:57:10 +08:00
parent 22796c6aff
commit 46843c8e19
5 changed files with 16 additions and 13 deletions

View File

@@ -114,8 +114,8 @@ class INvidiaProvider(Protocol):
# NVIDIA NIM API Endpoint
NVIDIA_API_URL = "https://integrate.api.nvidia.com/v1/chat/completions"
# 預設模型 (2026-03-31 ogt: 修正為 128k context 版的 Llama 3.1)
NVIDIA_DEFAULT_MODEL = "meta/llama-3.1-8b-instruct"
# 預設模型 (2026-03-31 ogt: 恢復為 nemotron-mini-4b-instruct)
NVIDIA_DEFAULT_MODEL = "nvidia/nemotron-mini-4b-instruct"
# 請求超時 (秒) - Nemotron 延遲 11-45s
NVIDIA_TIMEOUT = 60.0