AI QA / LLM QA Engineer 轉職指南
2026 最熱的 QA 新職位是 AI QA / LLM QA Engineer。需求暴增、供給稀缺、薪資溢價。但很多人不知道它到底在做什麼、也不知道自己能不能轉。這篇講清楚。
還在判斷 AI 對 QA 是危機還是機會?先看 AI 時代 QA 還有未來嗎。
一般 QA vs AI QA — 測的東西本質不同
flowchart TB
subgraph Normal["一般 QA · 確定性"]
N1["輸入 A → 一定得 B"]
N2["pass / fail 二元"]
N3["測功能正確性"]
end
subgraph AIQA["AI QA · 機率性"]
A1["同 prompt → 每次答不同"]
A2["品質分數 / 信心區間"]
A3["測幻覺·安全·偏見·一致性"]
end
style Normal fill:#06b6d4,color:#fff
style AIQA fill:#a855f7,color:#fff
關鍵差異:一般功能你能寫死 expected value;AI 輸出是機率性的、沒有單一正確答案、要評估「夠不夠好」。這就是為什麼需要一個專門角色。
AI QA 到底測什麼
mindmap
root((AI QA 測試範圍))
LLM 輸出品質
正確性 eval
幻覺率
一致性
RAG 系統
檢索準不準
引用對不對
AI Agent
多步驟對不對
工具呼叫正確性
安全與紅隊
jailbreak
prompt injection
偏見與合規
公平性
敏感內容
| 測試類型 | 在測什麼 | 站上深入文章 |
|---|---|---|
| LLM Evaluation | 輸出品質量化 | LLM Evaluation Testing |
| RAG 測試 | 檢索 + 生成品質 | RAG 系統測試 |
| Agent 測試 | 多步驟決策 | AI Agent 系統測試 |
| 紅隊測試 | 找安全漏洞 | LLM Red Teaming |
| 多模態 | 圖/音/影測試 | Multi-modal AI Testing |
該補的技能(3 層)
flowchart LR
L1["第 1 層 · 基礎<br>LLM API · temperature<br>token · prompt 結構"] --> L2["第 2 層 · 核心<br>eval 設計<br>怎麼量化『好不好』"]
L2 --> L3["第 3 層 · 進階<br>RAG / agent / 紅隊<br>AI 系統測試"]
style L1 fill:#06b6d4,color:#fff
style L2 fill:#a855f7,color:#fff
style L3 fill:#10b981,color:#fff
最該先練的是「eval 設計」 — 怎麼把模糊的「這答案還不錯」變成可重複、可比較的分數。這是 AI QA 的命根、也是多數人卡住的地方。
從現職 QA 轉過去的路線
flowchart TB
S1["先測公司現有 AI 功能<br>(有就從這開始)"] --> S2["學會用 LLM API<br>寫第一個 eval script"]
S2 --> S3["挑一類深入<br>RAG 或 agent 或紅隊"]
S3 --> S4["做出成果<br>建 eval pipeline / 抓到 AI bug"]
S4 --> S5["對外輸出<br>履歷 + 面試講 AI QA 經驗"]
style S1 fill:#06b6d4,color:#fff
style S5 fill:#10b981,color:#fff
沒有公司 AI 功能可測?用 side project — 接一個 LLM API、做一個小 RAG、自己寫 eval。有實作經驗比證照值錢。
完整轉型節奏可參考 手動 QA 轉型 AI-Augmented QA 90 天;技能取捨看 AI 取代不了的 QA 技能。
薪資與市場
| 面向 | 現況 |
|---|---|
| 薪資溢價 | 比同年資一般 QA 高約 15-30% |
| 供需 | 需求 >> 供給(會測 AI 的人稀缺) |
| 競爭者 | 多數 QA 不懂 eval、多數 ML 不懂測試、卡交集者吃香 |
| 風險 | 領域新、標準還在變、要持續學 |
稀缺的原因:它卡在「測試思維 × AI 理解」的交集。傳統 QA 補 AI 比 ML 工程師補測試容易 — 這是你的機會。
反模式
flowchart TD
Anti[轉 AI QA 反模式] --> A1["以為要先會訓練模型"]
Anti --> A2["只考證照不做實作"]
Anti --> A3["用測功能的方式測 AI<br>(寫死 expected)"]
Anti --> A4["只為薪資轉、不喜歡不確定性"]
Anti --> A5["不學 eval、只會手動試 prompt"]
style A1 fill:#ef4444,color:#fff
style A2 fill:#ef4444,color:#fff
style A3 fill:#ef4444,color:#fff
style A4 fill:#ef4444,color:#fff
style A5 fill:#ef4444,color:#fff
給 QA 的 5 句
- AI QA 測的是機率性輸出、不是確定性功能
- 不用會訓練模型、要會測模型行為
- eval 設計是命根、先練它
- 有實作經驗比證照值錢
- 卡在「測試 × AI」交集的人最稀缺
最後
AI QA 不是另一個職業、是 QA 的進化版。你既有的測試思維是最難補的部分、AI 知識反而好補。從測公司現有的 AI 功能、或一個 side project 的 eval 開始 — 半年後你就站在這個稀缺交集裡。
延伸閱讀: - AI 時代 QA 還有未來嗎 - AI 時代 QA 薪資與加薪談判 - AI 取代不了的 QA 技能 - LLM Evaluation Testing