ChatGPT vs Claude vs Gemini vs Copilot for QA — 2026 實戰選擇指南
給 QA 工程師的 LLM 工具完整對比。Claude vs ChatGPT vs Gemini vs Copilot vs Cursor 在 spec review / test case / code / debug 各場景實測、月費 vs 產出對比、安全紅線、組合配置建議。
📖 約 11 分鐘
📝 5264 字
🏷 6 tags
💡
TL;DR · 一分鐘看懂
給 QA 工程師的 LLM 工具完整對比。Claude vs ChatGPT vs Gemini vs Copilot vs Cursor 在 spec review / test case / code / debug 各場景實測、月費 vs 產出對比、安全紅線、組合配置建議。
ChatGPT vs Claude vs Gemini vs Copilot — QA 實戰選擇
「LLM 工具一堆、QA 該用哪個」每週被問。不同工具各有強項、選錯一年浪費幾千美金 + 沒效率。這篇給你 QA 角度的實戰對照。
一張圖選 model
flowchart TD
Task[QA 任務] --> Q1{場景?}
Q1 -->|Spec review / 長文| Claude
Q1 -->|寫 code| Cursor
Q1 -->|找資料 / 趨勢| Perplexity
Q1 -->|多模態 / 圖表| ChatGPT
Q1 -->|Google 生態整合| Gemini
Q1 -->|大量 code review| CodeRabbit
Claude --> C1["Sonnet 4.7 主力"]
Cursor --> CU1[切 Claude / GPT-4]
Perplexity --> P1[即時 web search]
style Claude fill:#a855f7,color:#fff
style Cursor fill:#06b6d4,color:#fff
完整對照表
| 維度 |
Claude |
ChatGPT |
Gemini |
Cursor |
Copilot |
| 寫作能力 |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐ |
⭐⭐⭐ |
N/A |
N/A |
| 思考鏈 / 推理 |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐ |
⭐⭐⭐ |
用 model |
用 model |
| Code 生成 |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐ |
| 誠實度(少幻覺) |
⭐⭐⭐⭐⭐ |
⭐⭐⭐ |
⭐⭐⭐ |
同 model |
同 |
| Context 長度 |
1M (Sonnet 4.7) |
128K (GPT-4o) |
1M (2.0) |
視 model |
視 |
| 多模態(圖) |
⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
N/A |
N/A |
| 語音對話 |
⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐ |
N/A |
N/A |
| Code interpreter |
❌ |
⭐⭐⭐⭐⭐ |
⭐⭐⭐ |
不需要 |
N/A |
| IDE 整合 |
⭐⭐⭐ (Claude Code) |
⭐⭐⭐ |
⭐⭐ |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
| 價格 (個人月費) |
$20 |
$20 |
$20 |
$20 |
$10 |
| 企業版 |
$30/user |
$60/user |
$30/user |
$40/user |
$20/user |
| API 便宜度 |
中 |
中 |
便宜 |
看 model |
用 GH |
QA 場景實測對比
場景 1:Spec Review(兩段式 prompt)
測試方法:餵 1200 字 PRD、跑兩段式 prompt
評分:列出問題的 relevance + completeness
| Model |
問題數 |
品質 |
編造率 |
| Claude Sonnet 4.7 |
18 |
⭐⭐⭐⭐⭐ |
5% |
| GPT-4o |
14 |
⭐⭐⭐⭐ |
12% |
| Gemini 2.0 |
11 |
⭐⭐⭐ |
18% |
Claude 大勝。長文 + 結構化思考是它強項。
場景 2:Test Case 生成
餵 user story、要 12 個 case(happy/邊界/異常/安全)
| Model |
完整度 |
邊界 case 比例 |
重複率 |
| Claude |
12/12 |
33% |
8% |
| GPT-4o |
11/12 |
25% |
15% |
| Gemini |
10/12 |
20% |
25% |
Claude / GPT-4o 接近、Gemini 多重複。
場景 3:寫 Playwright code
要求:寫一個 login E2E + POM 結構
| Model |
跑得起來 |
Best practice |
Selector 品質 |
| Cursor (Claude) |
✓ |
⭐⭐⭐⭐⭐ |
getByRole 為主 |
| Cursor (GPT-4) |
✓ |
⭐⭐⭐⭐⭐ |
getByRole 為主 |
| GitHub Copilot |
✓ |
⭐⭐⭐⭐ |
偶用 CSS |
| Claude (chat) |
✓ |
⭐⭐⭐⭐⭐ |
教科書級 |
| ChatGPT (chat) |
✓ |
⭐⭐⭐⭐ |
偶用過時 API |
場景 4:Debug stack trace
餵 100 行 Java stack trace、要找 root cause
| Model |
Root cause 對 |
建議實用 |
| Claude |
✓ |
⭐⭐⭐⭐⭐ |
| GPT-4o |
✓ |
⭐⭐⭐⭐ |
| Gemini |
7/10 |
⭐⭐⭐ |
場景 5:寫 PR description / 文件
| Model |
結構 |
簡潔 |
中英混排 |
| Claude |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
| GPT-4o |
⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐ |
| Gemini |
⭐⭐⭐ |
⭐⭐⭐ |
⭐⭐⭐ |
推薦組合配置
配置 A: 預算充足($60/月)— ⭐ 推薦
✓ Claude Pro $20 → spec / 寫作 / debug 主力
✓ Cursor Pro $20 → 寫 code 主力(裡面用 Claude)
✓ Perplexity Pro $20 → 找資料 / 比較工具
配置 B: 中等預算($30-40/月)
✓ Claude Pro $20 → 主要對話
✓ GitHub Copilot $10 → IDE 補位
+ Gemini Free / Perplexity Free
配置 C: 預算緊($0/月)
✓ Claude Free + ChatGPT Free + Gemini Free(輪流用)
✓ Cursor Free tier(限量但夠用)
+ DeepSeek / Qwen 自架 Ollama(無限免費)
安全:哪些不能用線上 LLM
flowchart TD
Code{要丟什麼?} --> Q1{含敏感?}
Q1 -->|無敏感| Public[Claude / ChatGPT 都可]
Q1 -->|含 PII / Secret| Q2{企業版?}
Q2 -->|有| Ent[Anthropic Team / ChatGPT Enterprise]
Q2 -->|沒| Local[Ollama 本地]
Q1 -->|有 source code| Q3{open source?}
Q3 -->|OSS| Public2[Public LLM OK]
Q3 -->|私有 / 商業| Ent2[企業版 + anonymize]
style Public fill:#10b981,color:#fff
style Ent fill:#a855f7,color:#fff
style Local fill:#f59e0b,color:#fff
本地 LLM 設置
# 1. 裝 Ollama
brew install ollama # macOS
# 2. 拉 model
ollama pull llama3.1:70b
ollama pull qwen2.5:32b # 中文強
ollama pull deepseek-coder:33b # code 強
# 3. 跑
ollama run llama3.1:70b
# 4. 接 Cursor / Continue
# Settings → Local model → http://localhost:11434
無限免費、完全離線、敏感資料安全。70B model 需要 64GB RAM、跑起來慢、但能用。
一年成本對比
| 方案 |
月 |
年 |
適合 |
| 全免費(輪流 + Ollama) |
$0 |
$0 |
學生 / 自學 |
| 配置 C |
$10 |
$120 |
Junior |
| 配置 B |
$30 |
$360 |
Mid |
| 配置 A |
$60 |
$720 |
Senior+ |
| 企業版(公司付) |
$100+ |
$1200+ |
公司付帳 |
反模式
flowchart TD
Anti[LLM 選擇反模式] --> A1["只用一個、不混搭"]
Anti --> A2["公司 code 丟 ChatGPT Free"]
Anti --> A3["寫 spec 用 GPT-4"]
Anti --> A4["寫 code 用 Claude chat 不用 Cursor"]
Anti --> A5["不試新 model 升級"]
Anti --> A6["免費版每天用爆"]
Anti --> A7["沒設 budget cap、API 燒爆"]
style A1 fill:#ef4444,color:#fff
style A2 fill:#ef4444,color:#fff
style A3 fill:#ef4444,color:#fff
style A4 fill:#ef4444,color:#fff
style A5 fill:#ef4444,color:#fff
style A6 fill:#ef4444,color:#fff
style A7 fill:#ef4444,color:#fff
給 QA 的 5 句
- 單選 → Claude;多選 → Claude + Cursor + Perplexity
- Spec / 寫作用 Claude、不要省
- 寫 code 用 Cursor(裡面切 Claude)勝過 chat 介面
- 公司 code 不丟線上、用 Ollama
- 每月試一個新工具、市場變太快
最後
QA 用 AI 不是「裝越多越強」、是「用對工具配對工作」。從 Claude Pro + Cursor Pro 兩個起跳、$40/月、覆蓋 90% QA 工作。剩下 10% 用免費版 + Ollama 補。
延伸:
- AI 共存的 QA 工具箱
- QA 工程師的 AI Workflow Daily Routine
- Prompt 範本庫