🏆 Speech-to-Speech 全球 #1

Gemini 3.8 Live Extended Thinking 評測 2026
語音推理 AI 新標準,繁中首發完整指南

📅 2026-09-17 | 分類:AI 語音模型 | 閱讀時間:約 13 分鐘
🎯 本文重點
Gemini 3.8 Live Extended Thinking 是 Google DeepMind 於 2026 年 9 月 15 日正式 GA 的語音+深度推理同步模型,Artificial Analysis Speech-to-Speech 評測全球第一。它和 Gemini 3.8 Flash 是完全不同的產品——Flash 做文字多模態,Live Extended Thinking 做即時語音+複雜推理。繁中評測幾乎為零,本文首發完整指南。

一、Gemini 3.8 Live Extended Thinking 是什麼?

2026 年的 AI 語音競賽正在加速白熱化。OpenAI 有 Realtime API、ElevenLabs 有 Conversational AI、Anthropic 即將推出語音版 Claude——而 Google 的答案是 Gemini 3.8 Live Extended Thinking

這個模型做到了一件以前沒有人做到的事:「邊思考邊說話」(Think-while-speak)。

傳統的語音 AI 流程是:聽→靜止思考→說。過程中有明顯的停頓,讓對話感覺生硬。Gemini 3.8 Live Extended Thinking 的突破在於:

📋 模型規格卡(2026-09-15 GA)

Model ID:gemini-3.8-live-extended-thinking
GA 日期:2026 年 9 月 15 日(stable)
輸入模態:語音(即時串流)+ 文字 + 圖片
輸出模態:語音(即時串流)+ 文字
延遲:首字節語音輸出 <800ms(Artificial Analysis 測試)
語言支援:40+ 語言,含繁體中文
評測排名:Artificial Analysis Speech-to-Speech #1(2026-09-16)
Context Window:1M tokens
API 平台:Google AI Studio + Vertex AI

二、與 Gemini 3.8 Flash 的關鍵差異(不是同一個模型)

⚠️ 重要澄清
很多人看到「Gemini 3.8」就以為是同一個系列的升級版。不對——Gemini 3.8 Flash(Sep 2 GA)和 Gemini 3.8 Live Extended Thinking(Sep 15 GA)是完全不同的產品線,針對不同場景設計。
比較維度 Gemini 3.8 Flash Gemini 3.8 Live Extended Thinking 本文主角
GA 日期 2026-09-02 2026-09-15
Model ID gemini-3.8-flash gemini-3.8-live-extended-thinking
主要模態 文字 + 圖片 + 影片(非即時) 語音(即時串流)+ 推理同步輸出
推理深度 三段 effort 調控(low/medium/high) Extended Thinking(長鏈推理,邊說邊思考)
延遲特性 低延遲文字輸出 語音串流,首字節 <800ms
使用場景 批次任務、文件摘要、圖片分析 即時語音對話、語音 Agent、語音客服
定價策略 維持 3.7 Flash intro rate(低) 競爭性定價(介於 Flash 和 Pro 之間)
評測亮點 文字生成品質/速度佳 Artificial Analysis Speech-to-Speech #1

選擇原則:你的任務需要即時語音對話 → 用 Live Extended Thinking;批次處理、文字生成、圖片分析 → 用 Flash。兩者配合使用效果最好。

📊 想深度掌握 Gemini 3.8 系列?

DataCamp 有 Google AI 官方認證課程,含 Gemini API 完整教學、語音 AI 開發實戰,繁中字幕支援。

📊 免費試用 DataCamp 🌊 DigitalOcean 部署

三、vs OpenAI Realtime API:旗鼓相當還是碾壓?

目前語音 AI API 市場的主要競爭格局:

🟢 Gemini 3.8 Live Extended Thinking(Google)

優勢:Speech-to-Speech 延遲最低(#1)、擴展推理邊說邊思考、1M context、Google Cloud 生態深度整合
限制:Extended Thinking 模式下 token 消耗較高、部分複雜多步驟任務仍在優化中
定價:競爭性(具體費率見 Google AI Studio)

🔵 OpenAI Realtime API(OpenAI)

優勢:GPT-5.4 底層、企業信任度高、Function Calling 語音版成熟
限制:延遲稍高(Artificial Analysis 評測 #3)、定價較貴($0.06/min 輸入,$0.24/min 輸出)
定價:GPT-4o Realtime:$0.06/$0.24 per minute in/out

🟡 ElevenLabs Conversational AI

優勢:語音品質最自然(情感豐富、角色扮演)、最多語音選項
限制:推理能力弱(語音包裝,底層是 GPT/Claude)、不支援複雜多步驟任務
定價:按字元計費 + Conversational AI 分鐘計費

比較維度 Gemini 3.8 Live ET 推薦 OpenAI Realtime ElevenLabs Conv. AI
延遲(首字節) <800ms(#1) ~1,200ms(#3) ~950ms(#2)
推理深度 Extended Thinking,複雜推理 GPT-5.4,推理強 弱(底層 LLM 依賴)
語音自然度 自然(Neural TTS) 自然 最自然(情感豐富)
多語言 40+ 語言,繁中優 50+ 語言 29 語言
邊思考邊說話 ✅ 核心功能 ❌ 無 ❌ 無
定價(估算) 中(Flash 和 Pro 之間) 高($0.06-0.24/min) 中低
企業支援 Vertex AI 企業版 OpenAI Enterprise 企業方案

結論:如果你需要語音 + 複雜推理(客服 FAQ 查詢、即時語音分析、語音代理任務執行),Gemini 3.8 Live Extended Thinking 是目前最佳選擇。如果你更看重 GPT-5.4 的推理品質且預算充足,OpenAI Realtime 仍是好選項。純語音品質/角色扮演選 ElevenLabs。

四、API 快速上手:5 步驟建立語音推理 Agent

前置需求

步驟一:取得 API Key 並安裝 SDK

# Python
pip install google-genai pyaudio

# 或 Node.js
npm install @google/genai

步驟二:建立基本語音串流連線(Python)

import asyncio
from google import genai
from google.genai import types

client = genai.Client(api_key="YOUR_API_KEY")

# 使用 Live Extended Thinking 模型
MODEL = "gemini-3.8-live-extended-thinking"

async def voice_agent():
    config = types.LiveConnectConfig(
        response_modalities=["AUDIO"],
        # 啟用 Extended Thinking(邊說邊思考)
        thinking_config=types.ThinkingConfig(
            include_thoughts=True,  # 在語音中包含思考過程
            thinking_budget=8192    # 最大思考 token 數
        ),
        speech_config=types.SpeechConfig(
            voice_config=types.VoiceConfig(
                prebuilt_voice_config=types.PrebuiltVoiceConfig(
                    voice_name="Aoede"  # 或 Charon, Fenrir, Kore, Puck
                )
            )
        )
    )
    
    async with client.aio.live.connect(model=MODEL, config=config) as session:
        # 發送文字查詢(也可以發送音訊串流)
        await session.send(
            input="請用中文說明 Agentic Commerce 是什麼,並給出台灣開發者的實際建議",
            end_of_turn=True
        )
        
        # 接收語音回應
        async for response in session.receive():
            if response.data:  # 音訊資料
                # 播放音訊(這裡簡化為儲存檔案)
                with open("response.pcm", "ab") as f:
                    f.write(response.data)
            if response.text:  # 文字轉錄
                print(f"AI 說:{response.text}")

asyncio.run(voice_agent())
💡 thinking_config 說明
include_thoughts=True 讓模型的推理過程也透過語音輸出(你會聽到「嗯,讓我想想……」這類自然停頓)。thinking_budget 控制最大思考量——設越高,推理越深但延遲越長。建議從 4096 開始調整。

步驟三:整合即時麥克風輸入

import pyaudio
import asyncio
from google import genai
from google.genai import types

# 音訊設定
SEND_SAMPLE_RATE = 16000
RECEIVE_SAMPLE_RATE = 24000
CHUNK_SIZE = 1024

async def live_voice_chat():
    client = genai.Client(api_key="YOUR_API_KEY")
    pya = pyaudio.PyAudio()
    
    config = types.LiveConnectConfig(
        response_modalities=["AUDIO"],
        thinking_config=types.ThinkingConfig(
            include_thoughts=True,
            thinking_budget=4096
        )
    )
    
    async with client.aio.live.connect(
        model="gemini-3.8-live-extended-thinking",
        config=config
    ) as session:
        
        # 開麥錄音串流
        mic_stream = pya.open(
            format=pyaudio.paInt16,
            channels=1,
            rate=SEND_SAMPLE_RATE,
            input=True,
            frames_per_buffer=CHUNK_SIZE
        )
        
        # 開喇叭輸出串流
        speaker_stream = pya.open(
            format=pyaudio.paInt16,
            channels=1,
            rate=RECEIVE_SAMPLE_RATE,
            output=True
        )
        
        async def send_audio():
            while True:
                data = mic_stream.read(CHUNK_SIZE, exception_on_overflow=False)
                await session.send(input={"data": data, "mime_type": "audio/pcm"})
                await asyncio.sleep(0)
        
        async def receive_audio():
            async for response in session.receive():
                if response.data:
                    speaker_stream.write(response.data)
        
        # 同時發送和接收
        await asyncio.gather(send_audio(), receive_audio())

asyncio.run(live_voice_chat())

步驟四:加上 Function Calling(讓語音 Agent 執行任務)

tools = [
    types.Tool(function_declarations=[
        types.FunctionDeclaration(
            name="search_taiwan_products",
            description="搜尋台灣市場產品資訊",
            parameters={
                "type": "object",
                "properties": {
                    "query": {"type": "string", "description": "搜尋關鍵字"},
                    "category": {"type": "string", "description": "產品類別"}
                },
                "required": ["query"]
            }
        )
    ])
]

config = types.LiveConnectConfig(
    response_modalities=["AUDIO", "TEXT"],
    thinking_config=types.ThinkingConfig(include_thoughts=True),
    tools=tools
)

步驟五:部署到 Cloud(DigitalOcean App Platform)

# Dockerfile(簡化版)
FROM python:3.11-slim
WORKDIR /app
COPY requirements.txt .
RUN pip install google-genai fastapi uvicorn websockets
COPY . .
EXPOSE 8080
CMD ["uvicorn", "main:app", "--host", "0.0.0.0", "--port", "8080"]

🌊 語音 AI 服務部署推薦

DigitalOcean Droplets 或 App Platform 非常適合部署 Gemini Live 語音服務——低延遲、全球節點、簡單計費,新用戶享 $200 免費額度。

🌊 立即試用 DigitalOcean ☁️ Cloudways 托管主機

五、台灣開發者三大應用場景

場景一:台灣企業語音客服 Agent(邊查資料邊回答)

傳統語音客服 IVR 系統遇到複雜問題只會說「請轉接人工」。Gemini 3.8 Live Extended Thinking 的 Extended Thinking 功能讓語音 Agent 可以:

技術亮點:Function Calling + Live Extended Thinking 組合,讓真實的後端查詢和語音回應無縫整合。台灣有 LINE 客服、網路購物等大量客服需求,繁體中文語音品質也已達商業可用等級。

場景二:即時語音會議 AI 助理(邊聽邊摘要)

Google Meet 等視訊會議常需要即時摘要或行動項目整理。Gemini 3.8 Live Extended Thinking 可以:

台灣商機:台灣企業會議文化重,繁中語音 AI 助理市場競品極少,Gemini 的繁中語音品質是決定性優勢。

場景三:語音驅動的 AI 代理(說話即操作)

結合 ZeroClick / MCP 等工具,Gemini 3.8 Live Extended Thinking 可以成為真正的語音驅動 AI 代理:

競爭優勢:Extended Thinking 讓 Agent 在語音對話中也能執行複雜多步驟任務,不只是簡單問答。這是 OpenAI Realtime API 目前還不支援的能力。

六、定價與配額:2026 年 9 月最新

Google 的正式定價以 Google AI Studio 頁面為準,以下是目前已知資訊:

使用層級內容費率
免費層(AI Studio)有限配額,適合測試$0(有速率限制)
Pay-as-you-go音訊輸入 + 音訊輸出計費競爭性定價(介 Flash 和 Pro 之間)
Vertex AI企業合規、SLA、私有部署企業合約,聯絡 Google 銷售
💡 定價建議
Extended Thinking 模式下 token 消耗較高(thinking tokens 也計費)。建議從低 thinking_budget(2048-4096)開始測試,找到品質和成本的平衡點。對於簡單問答場景,可以動態關閉 Extended Thinking 以節省費用。

七、已知限制與注意事項

⚠️ 使用前請注意以下限制(2026-09-17 資訊)
  • Thinking tokens 計費:Extended Thinking 的推理 tokens 也計入費用,複雜任務成本會高於 Flash
  • 長對話穩定性:超過 30 分鐘的連續語音對話偶有串流中斷,需實作重連機制
  • 台語/閩南語:繁體中文(國語)品質優秀,台語/閩南語尚未完整支援
  • 噪音環境:高噪音環境下語音識別準確率下降,建議加入 VAD(聲音活動偵測)前處理
  • 函式呼叫延遲:Function Calling 在 Extended Thinking 模式下有額外延遲(推理後才決定呼叫)
  • Context Window:雖有 1M tokens,但長時間語音對話的 context 管理需要應用層自行處理

八、FAQ 常見問題

Q1:Gemini 3.8 Live Extended Thinking 的「Extended Thinking」和一般版有什麼差?

一般的 Gemini Live 模型直接語音→回應,沒有深度推理步驟。Extended Thinking 版在回應前會進行類似「心理對話」的多步驟推理——特別適合需要分析、比較、計算的複雜問題。你在語音對話中可以聽到 AI 的思考過程(「讓我評估一下…」「有兩個可能性…」)。

Q2:跟 Gemini 3.8 Flash 哪個便宜?

Gemini 3.8 Flash 的文字定價維持 3.7 Flash intro rate(非常低)。Live Extended Thinking 的語音 API 定價不直接可比,因為計費單位不同(音訊分鐘 vs. 文字 tokens)。對於語音場景,兩者根本是不同用途,不存在直接比較。

Q3:可以用在 LINE Bot 嗎?

可以,但需要中間層。LINE Bot 目前不支援真正的即時語音串流,你需要:接收語音訊息 → 轉換為 PCM 格式 → 發送給 Gemini Live API → 接收語音回應 → 轉換回 m4a/mp3 → 透過 LINE Reply API 發送。這個流程比較複雜,延遲也會增加。建議用 LINE Voice Call Webhook(需 LINE Partner 資格)才能達到真正低延遲。

Q4:「Speech-to-Speech 全球 #1」是怎麼評測的?

Artificial Analysis(artificialanalysis.ai)是獨立的 AI 模型評測機構,他們的 Speech-to-Speech 評測包含:首字節延遲、語音品質(MOS 評分)、語音理解準確率、多語言能力等維度。Gemini 3.8 Live Extended Thinking 在 2026-09-16 的最新排名中综合得分第一。

Q5:和 Claude 的語音版相比如何?

Anthropic 的語音版 Claude 尚未正式 GA(2026-09 時點仍是 Preview)。目前語音 AI 市場的正式 GA 版本中,Gemini 3.8 Live Extended Thinking 是 Extended Thinking + 語音組合的唯一選項。Claude 語音版 GA 後會是強力競爭者,值得持續關注。

Q6:API Key 在哪申請?免費額度多少?

前往 Google AI Studio 申請免費 API Key,不需要信用卡。免費層有每分鐘請求限制(RPM)和每天使用量上限,適合開發測試。正式上線建議切換到 Pay-as-you-go 以解除限制。

結語:語音 AI 正在重新定義人機互動

Gemini 3.8 Live Extended Thinking 代表的不只是一個新模型——而是語音 AI 從「語音輸入輸出介面」進化為「語音推理 Agent」的關鍵里程碑。

「邊思考邊說話」打破了傳統語音 AI 的停頓感,讓對話更自然;Speech-to-Speech #1 的評測排名代表真實的技術領先;1M context window 支持複雜長任務。對台灣開發者來說,繁體中文語音品質已達商業可用,現在就是建立語音 AI 產品的最佳時機。

從客服 Agent、會議助理到語音驅動 AI 代理——未來兩年,語音會成為 AI 最主流的互動模式。Gemini 3.8 Live Extended Thinking,是你的起點。

🚀 開始建立你的語音 AI 應用

從 Gemini API 到雲端部署,完整技術棧一步到位。DigitalOcean $200 免費額度 + DataCamp AI 課程,台灣開發者最佳組合。

🌊 DigitalOcean $200 免費額度 📊 DataCamp AI 課程 ⚡ Systeme.io 自動化銷售