Gemini 3.8 Live Extended Thinking 評測 2026
📋 本文目錄
Gemini 3.8 Live Extended Thinking 是 Google DeepMind 於 2026 年 9 月 15 日正式 GA 的語音+深度推理同步模型,Artificial Analysis Speech-to-Speech 評測全球第一。它和 Gemini 3.8 Flash 是完全不同的產品——Flash 做文字多模態,Live Extended Thinking 做即時語音+複雜推理。繁中評測幾乎為零,本文首發完整指南。
一、Gemini 3.8 Live Extended Thinking 是什麼?
2026 年的 AI 語音競賽正在加速白熱化。OpenAI 有 Realtime API、ElevenLabs 有 Conversational AI、Anthropic 即將推出語音版 Claude——而 Google 的答案是 Gemini 3.8 Live Extended Thinking。
這個模型做到了一件以前沒有人做到的事:「邊思考邊說話」(Think-while-speak)。
傳統的語音 AI 流程是:聽→靜止思考→說。過程中有明顯的停頓,讓對話感覺生硬。Gemini 3.8 Live Extended Thinking 的突破在於:
- 🎙️ 語音輸入即時處理:不需要等到你說完整句話
- 🧠 推理過程可以聲音化:「讓我想一下……」「好,首先……」是真實的中間推理
- 🔊 語音輸出同步推理:說話和思考同步進行,延遲大幅降低
- 📋 複雜多步驟任務:可以邊說話邊執行長任務(查資料、計算、比較)
Model ID:
gemini-3.8-live-extended-thinkingGA 日期:2026 年 9 月 15 日(stable)
輸入模態:語音(即時串流)+ 文字 + 圖片
輸出模態:語音(即時串流)+ 文字
延遲:首字節語音輸出 <800ms(Artificial Analysis 測試)
語言支援:40+ 語言,含繁體中文
評測排名:Artificial Analysis Speech-to-Speech #1(2026-09-16)
Context Window:1M tokens
API 平台:Google AI Studio + Vertex AI
二、與 Gemini 3.8 Flash 的關鍵差異(不是同一個模型)
很多人看到「Gemini 3.8」就以為是同一個系列的升級版。不對——Gemini 3.8 Flash(Sep 2 GA)和 Gemini 3.8 Live Extended Thinking(Sep 15 GA)是完全不同的產品線,針對不同場景設計。
| 比較維度 | Gemini 3.8 Flash | Gemini 3.8 Live Extended Thinking 本文主角 |
|---|---|---|
| GA 日期 | 2026-09-02 | 2026-09-15 |
| Model ID | gemini-3.8-flash |
gemini-3.8-live-extended-thinking |
| 主要模態 | 文字 + 圖片 + 影片(非即時) | 語音(即時串流)+ 推理同步輸出 |
| 推理深度 | 三段 effort 調控(low/medium/high) | Extended Thinking(長鏈推理,邊說邊思考) |
| 延遲特性 | 低延遲文字輸出 | 語音串流,首字節 <800ms |
| 使用場景 | 批次任務、文件摘要、圖片分析 | 即時語音對話、語音 Agent、語音客服 |
| 定價策略 | 維持 3.7 Flash intro rate(低) | 競爭性定價(介於 Flash 和 Pro 之間) |
| 評測亮點 | 文字生成品質/速度佳 | Artificial Analysis Speech-to-Speech #1 |
選擇原則:你的任務需要即時語音對話 → 用 Live Extended Thinking;批次處理、文字生成、圖片分析 → 用 Flash。兩者配合使用效果最好。
📊 想深度掌握 Gemini 3.8 系列?
DataCamp 有 Google AI 官方認證課程,含 Gemini API 完整教學、語音 AI 開發實戰,繁中字幕支援。
📊 免費試用 DataCamp 🌊 DigitalOcean 部署三、vs OpenAI Realtime API:旗鼓相當還是碾壓?
目前語音 AI API 市場的主要競爭格局:
🟢 Gemini 3.8 Live Extended Thinking(Google)
優勢:Speech-to-Speech 延遲最低(#1)、擴展推理邊說邊思考、1M context、Google Cloud 生態深度整合
限制:Extended Thinking 模式下 token 消耗較高、部分複雜多步驟任務仍在優化中
定價:競爭性(具體費率見 Google AI Studio)
🔵 OpenAI Realtime API(OpenAI)
優勢:GPT-5.4 底層、企業信任度高、Function Calling 語音版成熟
限制:延遲稍高(Artificial Analysis 評測 #3)、定價較貴($0.06/min 輸入,$0.24/min 輸出)
定價:GPT-4o Realtime:$0.06/$0.24 per minute in/out
🟡 ElevenLabs Conversational AI
優勢:語音品質最自然(情感豐富、角色扮演)、最多語音選項
限制:推理能力弱(語音包裝,底層是 GPT/Claude)、不支援複雜多步驟任務
定價:按字元計費 + Conversational AI 分鐘計費
| 比較維度 | Gemini 3.8 Live ET 推薦 | OpenAI Realtime | ElevenLabs Conv. AI |
|---|---|---|---|
| 延遲(首字節) | <800ms(#1) | ~1,200ms(#3) | ~950ms(#2) |
| 推理深度 | Extended Thinking,複雜推理 | GPT-5.4,推理強 | 弱(底層 LLM 依賴) |
| 語音自然度 | 自然(Neural TTS) | 自然 | 最自然(情感豐富) |
| 多語言 | 40+ 語言,繁中優 | 50+ 語言 | 29 語言 |
| 邊思考邊說話 | ✅ 核心功能 | ❌ 無 | ❌ 無 |
| 定價(估算) | 中(Flash 和 Pro 之間) | 高($0.06-0.24/min) | 中低 |
| 企業支援 | Vertex AI 企業版 | OpenAI Enterprise | 企業方案 |
結論:如果你需要語音 + 複雜推理(客服 FAQ 查詢、即時語音分析、語音代理任務執行),Gemini 3.8 Live Extended Thinking 是目前最佳選擇。如果你更看重 GPT-5.4 的推理品質且預算充足,OpenAI Realtime 仍是好選項。純語音品質/角色扮演選 ElevenLabs。
四、API 快速上手:5 步驟建立語音推理 Agent
前置需求
- Google AI Studio 帳號(aistudio.google.com)
- Python 3.10+ 或 Node.js 18+
- 麥克風/音訊輸入設備(本機測試)
步驟一:取得 API Key 並安裝 SDK
# Python
pip install google-genai pyaudio
# 或 Node.js
npm install @google/genai
步驟二:建立基本語音串流連線(Python)
import asyncio
from google import genai
from google.genai import types
client = genai.Client(api_key="YOUR_API_KEY")
# 使用 Live Extended Thinking 模型
MODEL = "gemini-3.8-live-extended-thinking"
async def voice_agent():
config = types.LiveConnectConfig(
response_modalities=["AUDIO"],
# 啟用 Extended Thinking(邊說邊思考)
thinking_config=types.ThinkingConfig(
include_thoughts=True, # 在語音中包含思考過程
thinking_budget=8192 # 最大思考 token 數
),
speech_config=types.SpeechConfig(
voice_config=types.VoiceConfig(
prebuilt_voice_config=types.PrebuiltVoiceConfig(
voice_name="Aoede" # 或 Charon, Fenrir, Kore, Puck
)
)
)
)
async with client.aio.live.connect(model=MODEL, config=config) as session:
# 發送文字查詢(也可以發送音訊串流)
await session.send(
input="請用中文說明 Agentic Commerce 是什麼,並給出台灣開發者的實際建議",
end_of_turn=True
)
# 接收語音回應
async for response in session.receive():
if response.data: # 音訊資料
# 播放音訊(這裡簡化為儲存檔案)
with open("response.pcm", "ab") as f:
f.write(response.data)
if response.text: # 文字轉錄
print(f"AI 說:{response.text}")
asyncio.run(voice_agent())
include_thoughts=True 讓模型的推理過程也透過語音輸出(你會聽到「嗯,讓我想想……」這類自然停頓)。thinking_budget 控制最大思考量——設越高,推理越深但延遲越長。建議從 4096 開始調整。
步驟三:整合即時麥克風輸入
import pyaudio
import asyncio
from google import genai
from google.genai import types
# 音訊設定
SEND_SAMPLE_RATE = 16000
RECEIVE_SAMPLE_RATE = 24000
CHUNK_SIZE = 1024
async def live_voice_chat():
client = genai.Client(api_key="YOUR_API_KEY")
pya = pyaudio.PyAudio()
config = types.LiveConnectConfig(
response_modalities=["AUDIO"],
thinking_config=types.ThinkingConfig(
include_thoughts=True,
thinking_budget=4096
)
)
async with client.aio.live.connect(
model="gemini-3.8-live-extended-thinking",
config=config
) as session:
# 開麥錄音串流
mic_stream = pya.open(
format=pyaudio.paInt16,
channels=1,
rate=SEND_SAMPLE_RATE,
input=True,
frames_per_buffer=CHUNK_SIZE
)
# 開喇叭輸出串流
speaker_stream = pya.open(
format=pyaudio.paInt16,
channels=1,
rate=RECEIVE_SAMPLE_RATE,
output=True
)
async def send_audio():
while True:
data = mic_stream.read(CHUNK_SIZE, exception_on_overflow=False)
await session.send(input={"data": data, "mime_type": "audio/pcm"})
await asyncio.sleep(0)
async def receive_audio():
async for response in session.receive():
if response.data:
speaker_stream.write(response.data)
# 同時發送和接收
await asyncio.gather(send_audio(), receive_audio())
asyncio.run(live_voice_chat())
步驟四:加上 Function Calling(讓語音 Agent 執行任務)
tools = [
types.Tool(function_declarations=[
types.FunctionDeclaration(
name="search_taiwan_products",
description="搜尋台灣市場產品資訊",
parameters={
"type": "object",
"properties": {
"query": {"type": "string", "description": "搜尋關鍵字"},
"category": {"type": "string", "description": "產品類別"}
},
"required": ["query"]
}
)
])
]
config = types.LiveConnectConfig(
response_modalities=["AUDIO", "TEXT"],
thinking_config=types.ThinkingConfig(include_thoughts=True),
tools=tools
)
步驟五:部署到 Cloud(DigitalOcean App Platform)
# Dockerfile(簡化版)
FROM python:3.11-slim
WORKDIR /app
COPY requirements.txt .
RUN pip install google-genai fastapi uvicorn websockets
COPY . .
EXPOSE 8080
CMD ["uvicorn", "main:app", "--host", "0.0.0.0", "--port", "8080"]
🌊 語音 AI 服務部署推薦
DigitalOcean Droplets 或 App Platform 非常適合部署 Gemini Live 語音服務——低延遲、全球節點、簡單計費,新用戶享 $200 免費額度。
🌊 立即試用 DigitalOcean ☁️ Cloudways 托管主機五、台灣開發者三大應用場景
場景一:台灣企業語音客服 Agent(邊查資料邊回答)
傳統語音客服 IVR 系統遇到複雜問題只會說「請轉接人工」。Gemini 3.8 Live Extended Thinking 的 Extended Thinking 功能讓語音 Agent 可以:
- 客戶問:「我的訂單 #12345 現在到哪了?運費怎麼算的?」
- Agent 邊說「讓我幫你查一下……」邊呼叫訂單 API
- 取得資料後無縫回答:「你的訂單已到台中轉運站,預計明日送達。運費是因為……」
技術亮點:Function Calling + Live Extended Thinking 組合,讓真實的後端查詢和語音回應無縫整合。台灣有 LINE 客服、網路購物等大量客服需求,繁體中文語音品質也已達商業可用等級。
場景二:即時語音會議 AI 助理(邊聽邊摘要)
Google Meet 等視訊會議常需要即時摘要或行動項目整理。Gemini 3.8 Live Extended Thinking 可以:
- 即時聽取會議語音串流
- Extended Thinking 深度理解討論內容(不只關鍵字,理解脈絡)
- 在會議中主動語音介入:「剛才 A 提到的預算問題,我有一些相關資料……」
- 會議結束後立即提供結構化摘要和行動項目
台灣商機:台灣企業會議文化重,繁中語音 AI 助理市場競品極少,Gemini 的繁中語音品質是決定性優勢。
場景三:語音驅動的 AI 代理(說話即操作)
結合 ZeroClick / MCP 等工具,Gemini 3.8 Live Extended Thinking 可以成為真正的語音驅動 AI 代理:
- 「幫我把這份 PDF 摘要成三點,然後寄給 John」
- Agent 邊說「好,我先分析 PDF……」邊執行 PDF 摘要工具
- 「已摘要完成:第一點是……第二點是……要我直接寄嗎?」
- 「好,已寄出。」(執行郵件 API)
競爭優勢:Extended Thinking 讓 Agent 在語音對話中也能執行複雜多步驟任務,不只是簡單問答。這是 OpenAI Realtime API 目前還不支援的能力。
六、定價與配額:2026 年 9 月最新
Google 的正式定價以 Google AI Studio 頁面為準,以下是目前已知資訊:
| 使用層級 | 內容 | 費率 |
|---|---|---|
| 免費層(AI Studio) | 有限配額,適合測試 | $0(有速率限制) |
| Pay-as-you-go | 音訊輸入 + 音訊輸出計費 | 競爭性定價(介 Flash 和 Pro 之間) |
| Vertex AI | 企業合規、SLA、私有部署 | 企業合約,聯絡 Google 銷售 |
Extended Thinking 模式下 token 消耗較高(thinking tokens 也計費)。建議從低 thinking_budget(2048-4096)開始測試,找到品質和成本的平衡點。對於簡單問答場景,可以動態關閉 Extended Thinking 以節省費用。
七、已知限制與注意事項
- Thinking tokens 計費:Extended Thinking 的推理 tokens 也計入費用,複雜任務成本會高於 Flash
- 長對話穩定性:超過 30 分鐘的連續語音對話偶有串流中斷,需實作重連機制
- 台語/閩南語:繁體中文(國語)品質優秀,台語/閩南語尚未完整支援
- 噪音環境:高噪音環境下語音識別準確率下降,建議加入 VAD(聲音活動偵測)前處理
- 函式呼叫延遲:Function Calling 在 Extended Thinking 模式下有額外延遲(推理後才決定呼叫)
- Context Window:雖有 1M tokens,但長時間語音對話的 context 管理需要應用層自行處理
八、FAQ 常見問題
Q1:Gemini 3.8 Live Extended Thinking 的「Extended Thinking」和一般版有什麼差?
一般的 Gemini Live 模型直接語音→回應,沒有深度推理步驟。Extended Thinking 版在回應前會進行類似「心理對話」的多步驟推理——特別適合需要分析、比較、計算的複雜問題。你在語音對話中可以聽到 AI 的思考過程(「讓我評估一下…」「有兩個可能性…」)。
Q2:跟 Gemini 3.8 Flash 哪個便宜?
Gemini 3.8 Flash 的文字定價維持 3.7 Flash intro rate(非常低)。Live Extended Thinking 的語音 API 定價不直接可比,因為計費單位不同(音訊分鐘 vs. 文字 tokens)。對於語音場景,兩者根本是不同用途,不存在直接比較。
Q3:可以用在 LINE Bot 嗎?
可以,但需要中間層。LINE Bot 目前不支援真正的即時語音串流,你需要:接收語音訊息 → 轉換為 PCM 格式 → 發送給 Gemini Live API → 接收語音回應 → 轉換回 m4a/mp3 → 透過 LINE Reply API 發送。這個流程比較複雜,延遲也會增加。建議用 LINE Voice Call Webhook(需 LINE Partner 資格)才能達到真正低延遲。
Q4:「Speech-to-Speech 全球 #1」是怎麼評測的?
Artificial Analysis(artificialanalysis.ai)是獨立的 AI 模型評測機構,他們的 Speech-to-Speech 評測包含:首字節延遲、語音品質(MOS 評分)、語音理解準確率、多語言能力等維度。Gemini 3.8 Live Extended Thinking 在 2026-09-16 的最新排名中综合得分第一。
Q5:和 Claude 的語音版相比如何?
Anthropic 的語音版 Claude 尚未正式 GA(2026-09 時點仍是 Preview)。目前語音 AI 市場的正式 GA 版本中,Gemini 3.8 Live Extended Thinking 是 Extended Thinking + 語音組合的唯一選項。Claude 語音版 GA 後會是強力競爭者,值得持續關注。
Q6:API Key 在哪申請?免費額度多少?
前往 Google AI Studio 申請免費 API Key,不需要信用卡。免費層有每分鐘請求限制(RPM)和每天使用量上限,適合開發測試。正式上線建議切換到 Pay-as-you-go 以解除限制。
・ZeroClick 完整教學:讓 AI Agent 幫你賣東西
・Mastra 完整教學:TypeScript AI Agent Framework
・GitHub Copilot HydraFusion:多模型 Orchestration 省費 67%
結語:語音 AI 正在重新定義人機互動
Gemini 3.8 Live Extended Thinking 代表的不只是一個新模型——而是語音 AI 從「語音輸入輸出介面」進化為「語音推理 Agent」的關鍵里程碑。
「邊思考邊說話」打破了傳統語音 AI 的停頓感,讓對話更自然;Speech-to-Speech #1 的評測排名代表真實的技術領先;1M context window 支持複雜長任務。對台灣開發者來說,繁體中文語音品質已達商業可用,現在就是建立語音 AI 產品的最佳時機。
從客服 Agent、會議助理到語音驅動 AI 代理——未來兩年,語音會成為 AI 最主流的互動模式。Gemini 3.8 Live Extended Thinking,是你的起點。
🚀 開始建立你的語音 AI 應用
從 Gemini API 到雲端部署,完整技術棧一步到位。DigitalOcean $200 免費額度 + DataCamp AI 課程,台灣開發者最佳組合。
🌊 DigitalOcean $200 免費額度 📊 DataCamp AI 課程 ⚡ Systeme.io 自動化銷售