模型配置
模型配置
概述
模型配置頁面用於管理 LLM 供應商和模型參數。APP 端支援多供應商同時配置,系統根據所選模型自動切換 API 格式和能力偵測。

供應商支援
| 供應商 | API 格式 | 說明 |
|---|---|---|
| Anthropic | anthropic | Claude 系列模型 |
| OpenAI | openai | GPT / o 系列模型 |
| DeepSeek | openai | DeepSeek-chat / reasoner |
| Qwen(通義千問) | openai | Qwen-plus / Qwen-max |
| Gemini | openai | Google Gemini 系列 |
| 自訂 | openai / anthropic | 相容 OpenAI 或 Anthropic 格式的第三方服務 |
配置項
| 參數 | 說明 |
|---|---|
| 供應商選擇 | 從下拉列表選擇 LLM 供應商 |
| API Key | 供應商 API 金鑰(加密儲存) |
| Base URL | API 端點位址(自訂供應商必填) |
| apiFormat | API 協定格式:anthropic 或 openai |
| 模型選擇 | 從供應商可用模型列表中選擇 |
| tokensRespLimit | 每輪最大輸出 token 數 |
模型能力標記
系統透過 resolveCapabilities 自動偵測模型能力,影響多模態輸入處理:
| 能力 | 說明 | 影響 |
|---|---|---|
| vision | 圖片理解 | 是否接受圖片輸入 |
| document | 文件理解 | 是否接受 PDF 等文件輸入 |
| audio | 音訊理解 | 是否接受音訊輸入 |
| tool_use | 工具呼叫 | 是否支援 function calling |
上下文視窗
各模型的預設上下文視窗大小:
| 模型 | 上下文視窗 |
|---|---|
| Claude Sonnet 4 / Opus 4 / Claude 4 | 200,000 tokens |
| GPT-4o / GPT-4o-mini / GPT-4-turbo | 128,000 tokens |
| GPT-4.1 | 1,000,000 tokens |
| o3 / o4-mini | 200,000 tokens |
| DeepSeek-chat / DeepSeek-reasoner | 64,000 tokens |
| Qwen-plus / Qwen-max | 128,000 tokens |
完整模型列表請參考 支援的模型列表。
操作指南
如何配置模型
- 開啟 APP → 左側設定選單 → 模型
- 在供應商列表中選擇你要使用的 LLM 供應商(如 Anthropic)
- 填入該供應商提供的 API Key
- (可選)如果使用第三方相容服務,修改 Base URL 為服務商提供的端點位址
- 在模型下拉列表中選擇具體模型(如 Claude Sonnet 4)
- 點擊儲存
注意:API Key 以加密形式儲存在本地,不會上傳到雲端。切勿將 API Key 分享給他人或提交到程式碼倉庫。
如何切換模型
配置多個供應商後,隨時可以切換目前使用的模型。切換後,下一次對話將使用新模型。已有對話的歷史記錄不受影響。
模型選型建議
不同場景適合不同的模型,以下是推薦組合:
| 使用場景 | 推薦模型 | 原因 |
|---|---|---|
| 日常對話與輕量任務 | GPT-4o-mini / Qwen-plus | 回應快速、成本低 |
| 複雜推理與長文件分析 | Claude Opus 4 / Claude Sonnet 4 | 推理能力強、200K 長上下文、支援 document 輸入 |
| 程式碼開發與除錯 | DeepSeek-chat / Claude Sonnet 4 | 程式碼理解能力突出 |
| 超長上下文(整個程式碼庫) | GPT-4.1 | 1M token 上下文視窗 |
| 需要圖片理解 | Claude Sonnet 4 / GPT-4o | 支援 vision 能力 |
| 成本敏感 | Qwen-plus / DeepSeek-chat | 價格最低 |
| 需要深度推理(數學/邏輯) | o3 / DeepSeek-reasoner | 推理鏈模型,但 DeepSeek-reasoner 不支援工具呼叫 |
提示:如果不確定選哪個,建議從 Claude Sonnet 4 開始 —— 它在推理、程式碼、工具呼叫和多模態方面表現均衡。
上下文視窗對使用者的實際影響
上下文視窗決定了 Agent 單次對話中能「記住」多少內容:
| 視窗大小 | 大約等於 | 適用場景 |
|---|---|---|
| 64K tokens | ~100 頁純文字 或 ~5 個中型程式碼檔案 | 簡短對話、單檔案操作 |
| 128K tokens | ~200 頁純文字 或 ~10 個程式碼檔案 | 中等複雜度專案、多檔案操作 |
| 200K tokens | ~300 頁純文字 或 ~15 個程式碼檔案 | 複雜專案、長對話、PDF 文件分析 |
| 1M tokens | ~1500 頁純文字 或 ~70 個程式碼檔案 | 超大程式碼庫分析、全書級文件 |
當對話內容接近視窗上限時,系統會自動觸發上下文壓縮,智慧保留最重要的資訊。
tokensRespLimit 的影響
tokensRespLimit 控制 Agent 每輪回覆的最大 token 數:
| 設定值 | 影響 |
|---|---|
| 太小(如 500) | Agent 的回覆可能被截斷,複雜分析或長程式碼生成會不完整 |
| 適中(如 4096,推薦預設) | 平衡回覆完整性和回應速度 |
| 太大(如 32000) | Agent 可以給出很長的回覆,但會增加等待時間和費用 |
建議:保持預設值即可。如果頻繁遇到回覆被截斷的情況,可以適當增大。
常見問題
API Key 無效
- 確認 Key 是否正確複製(注意前後空格)
- 確認 Key 對應的供應商是否選擇正確
- 確認 Key 是否已過期或被吊銷
請求逾時
- 檢查網路連線
- 如果使用自訂 Base URL,確認位址可達
- 部分模型在高負載時可能回應較慢,可稍後重試
模型回覆品質不佳
- 嘗試切換到更強的模型(如從 GPT-4o-mini 切換到 Claude Sonnet 4)
- 檢查 tokensRespLimit 是否設定過小
- 最佳化你的提示詞,提供更明確的指令
