AI QA / LLM QA Engineer 轉職指南

2026 最熱的 QA 新職位是 AI QA / LLM QA Engineer。需求暴增、供給稀缺、薪資溢價。但很多人不知道它到底在做什麼、也不知道自己能不能轉。這篇講清楚。

還在判斷 AI 對 QA 是危機還是機會?先看 AI 時代 QA 還有未來嗎

一般 QA vs AI QA — 測的東西本質不同

flowchart TB
    subgraph Normal["一般 QA · 確定性"]
        N1["輸入 A → 一定得 B"]
        N2["pass / fail 二元"]
        N3["測功能正確性"]
    end
    subgraph AIQA["AI QA · 機率性"]
        A1["同 prompt → 每次答不同"]
        A2["品質分數 / 信心區間"]
        A3["測幻覺·安全·偏見·一致性"]
    end

    style Normal fill:#06b6d4,color:#fff
    style AIQA fill:#a855f7,color:#fff

關鍵差異:一般功能你能寫死 expected value;AI 輸出是機率性的、沒有單一正確答案、要評估「夠不夠好」。這就是為什麼需要一個專門角色。

AI QA 到底測什麼

mindmap
  root((AI QA 測試範圍))
    LLM 輸出品質
      正確性 eval
      幻覺率
      一致性
    RAG 系統
      檢索準不準
      引用對不對
    AI Agent
      多步驟對不對
      工具呼叫正確性
    安全與紅隊
      jailbreak
      prompt injection
    偏見與合規
      公平性
      敏感內容
測試類型 在測什麼 站上深入文章
LLM Evaluation 輸出品質量化 LLM Evaluation Testing
RAG 測試 檢索 + 生成品質 RAG 系統測試
Agent 測試 多步驟決策 AI Agent 系統測試
紅隊測試 找安全漏洞 LLM Red Teaming
多模態 圖/音/影測試 Multi-modal AI Testing

該補的技能(3 層)

flowchart LR
    L1["第 1 層 · 基礎<br>LLM API · temperature<br>token · prompt 結構"] --> L2["第 2 層 · 核心<br>eval 設計<br>怎麼量化『好不好』"]
    L2 --> L3["第 3 層 · 進階<br>RAG / agent / 紅隊<br>AI 系統測試"]

    style L1 fill:#06b6d4,color:#fff
    style L2 fill:#a855f7,color:#fff
    style L3 fill:#10b981,color:#fff

最該先練的是「eval 設計」 — 怎麼把模糊的「這答案還不錯」變成可重複、可比較的分數。這是 AI QA 的命根、也是多數人卡住的地方。

從現職 QA 轉過去的路線

flowchart TB
    S1["先測公司現有 AI 功能<br>(有就從這開始)"] --> S2["學會用 LLM API<br>寫第一個 eval script"]
    S2 --> S3["挑一類深入<br>RAG 或 agent 或紅隊"]
    S3 --> S4["做出成果<br>建 eval pipeline / 抓到 AI bug"]
    S4 --> S5["對外輸出<br>履歷 + 面試講 AI QA 經驗"]

    style S1 fill:#06b6d4,color:#fff
    style S5 fill:#10b981,color:#fff

沒有公司 AI 功能可測?用 side project — 接一個 LLM API、做一個小 RAG、自己寫 eval。有實作經驗比證照值錢

完整轉型節奏可參考 手動 QA 轉型 AI-Augmented QA 90 天;技能取捨看 AI 取代不了的 QA 技能

薪資與市場

面向 現況
薪資溢價 比同年資一般 QA 高約 15-30%
供需 需求 >> 供給(會測 AI 的人稀缺)
競爭者 多數 QA 不懂 eval、多數 ML 不懂測試、卡交集者吃香
風險 領域新、標準還在變、要持續學

稀缺的原因:它卡在「測試思維 × AI 理解」的交集。傳統 QA 補 AI 比 ML 工程師補測試容易 — 這是你的機會。

反模式

flowchart TD
    Anti[轉 AI QA 反模式] --> A1["以為要先會訓練模型"]
    Anti --> A2["只考證照不做實作"]
    Anti --> A3["用測功能的方式測 AI<br>(寫死 expected)"]
    Anti --> A4["只為薪資轉、不喜歡不確定性"]
    Anti --> A5["不學 eval、只會手動試 prompt"]

    style A1 fill:#ef4444,color:#fff
    style A2 fill:#ef4444,color:#fff
    style A3 fill:#ef4444,color:#fff
    style A4 fill:#ef4444,color:#fff
    style A5 fill:#ef4444,color:#fff

給 QA 的 5 句

  1. AI QA 測的是機率性輸出、不是確定性功能
  2. 不用會訓練模型、要會測模型行為
  3. eval 設計是命根、先練它
  4. 有實作經驗比證照值錢
  5. 卡在「測試 × AI」交集的人最稀缺

最後

AI QA 不是另一個職業、是 QA 的進化版。你既有的測試思維是最難補的部分、AI 知識反而好補。從測公司現有的 AI 功能、或一個 side project 的 eval 開始 — 半年後你就站在這個稀缺交集裡。

延伸閱讀: - AI 時代 QA 還有未來嗎 - AI 時代 QA 薪資與加薪談判 - AI 取代不了的 QA 技能 - LLM Evaluation Testing