ChatGPT vs Claude vs Gemini vs Copilot — QA 實戰選擇

「LLM 工具一堆、QA 該用哪個」每週被問。不同工具各有強項、選錯一年浪費幾千美金 + 沒效率。這篇給你 QA 角度的實戰對照。

一張圖選 model

flowchart TD
    Task[QA 任務] --> Q1{場景?}

    Q1 -->|Spec review / 長文| Claude
    Q1 -->|寫 code| Cursor
    Q1 -->|找資料 / 趨勢| Perplexity
    Q1 -->|多模態 / 圖表| ChatGPT
    Q1 -->|Google 生態整合| Gemini
    Q1 -->|大量 code review| CodeRabbit

    Claude --> C1["Sonnet 4.7 主力"]
    Cursor --> CU1[切 Claude / GPT-4]
    Perplexity --> P1[即時 web search]

    style Claude fill:#a855f7,color:#fff
    style Cursor fill:#06b6d4,color:#fff

完整對照表

維度 Claude ChatGPT Gemini Cursor Copilot
寫作能力 ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐ N/A N/A
思考鏈 / 推理 ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐ 用 model 用 model
Code 生成 ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐
誠實度(少幻覺) ⭐⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐ 同 model
Context 長度 1M (Sonnet 4.7) 128K (GPT-4o) 1M (2.0) 視 model
多模態(圖) ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ N/A N/A
語音對話 ⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ N/A N/A
Code interpreter ⭐⭐⭐⭐⭐ ⭐⭐⭐ 不需要 N/A
IDE 整合 ⭐⭐⭐ (Claude Code) ⭐⭐⭐ ⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐
價格 (個人月費) $20 $20 $20 $20 $10
企業版 $30/user $60/user $30/user $40/user $20/user
API 便宜度 便宜 看 model 用 GH

QA 場景實測對比

場景 1:Spec Review(兩段式 prompt)

測試方法:餵 1200 字 PRD、跑兩段式 prompt
評分:列出問題的 relevance + completeness
Model 問題數 品質 編造率
Claude Sonnet 4.7 18 ⭐⭐⭐⭐⭐ 5%
GPT-4o 14 ⭐⭐⭐⭐ 12%
Gemini 2.0 11 ⭐⭐⭐ 18%

Claude 大勝。長文 + 結構化思考是它強項。

場景 2:Test Case 生成

餵 user story、要 12 個 case(happy/邊界/異常/安全)
Model 完整度 邊界 case 比例 重複率
Claude 12/12 33% 8%
GPT-4o 11/12 25% 15%
Gemini 10/12 20% 25%

Claude / GPT-4o 接近、Gemini 多重複。

場景 3:寫 Playwright code

要求:寫一個 login E2E + POM 結構
Model 跑得起來 Best practice Selector 品質
Cursor (Claude) ⭐⭐⭐⭐⭐ getByRole 為主
Cursor (GPT-4) ⭐⭐⭐⭐⭐ getByRole 為主
GitHub Copilot ⭐⭐⭐⭐ 偶用 CSS
Claude (chat) ⭐⭐⭐⭐⭐ 教科書級
ChatGPT (chat) ⭐⭐⭐⭐ 偶用過時 API

場景 4:Debug stack trace

餵 100 行 Java stack trace、要找 root cause
Model Root cause 對 建議實用
Claude ⭐⭐⭐⭐⭐
GPT-4o ⭐⭐⭐⭐
Gemini 7/10 ⭐⭐⭐

場景 5:寫 PR description / 文件

Model 結構 簡潔 中英混排
Claude ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐
GPT-4o ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐
Gemini ⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐

推薦組合配置

配置 A: 預算充足($60/月)— ⭐ 推薦

✓ Claude Pro $20      → spec / 寫作 / debug 主力
✓ Cursor Pro $20      → 寫 code 主力(裡面用 Claude)
✓ Perplexity Pro $20  → 找資料 / 比較工具

配置 B: 中等預算($30-40/月)

✓ Claude Pro $20     → 主要對話
✓ GitHub Copilot $10 → IDE 補位
+ Gemini Free / Perplexity Free

配置 C: 預算緊($0/月)

✓ Claude Free + ChatGPT Free + Gemini Free(輪流用)
✓ Cursor Free tier(限量但夠用)
+ DeepSeek / Qwen 自架 Ollama(無限免費)

安全:哪些不能用線上 LLM

flowchart TD
    Code{要丟什麼?} --> Q1{含敏感?}
    Q1 -->|無敏感| Public[Claude / ChatGPT 都可]
    Q1 -->|含 PII / Secret| Q2{企業版?}
    Q2 -->|有| Ent[Anthropic Team / ChatGPT Enterprise]
    Q2 -->|沒| Local[Ollama 本地]

    Q1 -->|有 source code| Q3{open source?}
    Q3 -->|OSS| Public2[Public LLM OK]
    Q3 -->|私有 / 商業| Ent2[企業版 + anonymize]

    style Public fill:#10b981,color:#fff
    style Ent fill:#a855f7,color:#fff
    style Local fill:#f59e0b,color:#fff

本地 LLM 設置

# 1. 裝 Ollama
brew install ollama  # macOS

# 2. 拉 model
ollama pull llama3.1:70b
ollama pull qwen2.5:32b      # 中文強
ollama pull deepseek-coder:33b # code 強

# 3. 跑
ollama run llama3.1:70b

# 4. 接 Cursor / Continue
# Settings → Local model → http://localhost:11434

無限免費、完全離線、敏感資料安全。70B model 需要 64GB RAM、跑起來慢、但能用。

一年成本對比

方案 適合
全免費(輪流 + Ollama) $0 $0 學生 / 自學
配置 C $10 $120 Junior
配置 B $30 $360 Mid
配置 A $60 $720 Senior+
企業版(公司付) $100+ $1200+ 公司付帳

反模式

flowchart TD
    Anti[LLM 選擇反模式] --> A1["只用一個、不混搭"]
    Anti --> A2["公司 code 丟 ChatGPT Free"]
    Anti --> A3["寫 spec 用 GPT-4"]
    Anti --> A4["寫 code 用 Claude chat 不用 Cursor"]
    Anti --> A5["不試新 model 升級"]
    Anti --> A6["免費版每天用爆"]
    Anti --> A7["沒設 budget cap、API 燒爆"]

    style A1 fill:#ef4444,color:#fff
    style A2 fill:#ef4444,color:#fff
    style A3 fill:#ef4444,color:#fff
    style A4 fill:#ef4444,color:#fff
    style A5 fill:#ef4444,color:#fff
    style A6 fill:#ef4444,color:#fff
    style A7 fill:#ef4444,color:#fff

給 QA 的 5 句

  1. 單選 → Claude;多選 → Claude + Cursor + Perplexity
  2. Spec / 寫作用 Claude、不要省
  3. 寫 code 用 Cursor(裡面切 Claude)勝過 chat 介面
  4. 公司 code 不丟線上、用 Ollama
  5. 每月試一個新工具、市場變太快

最後

QA 用 AI 不是「裝越多越強」、是「用對工具配對工作」。從 Claude Pro + Cursor Pro 兩個起跳、$40/月、覆蓋 90% QA 工作。剩下 10% 用免費版 + Ollama 補。

延伸: - AI 共存的 QA 工具箱 - QA 工程師的 AI Workflow Daily Routine - Prompt 範本庫