← 企業洞察
繁體中文 English 简体中文
Levi · LinkedIn · 2026-09-25

廣東話AI能力2026:研究數據、模型差異與香港用戶的實際選擇

粵語AI能力有學術框架與部分數據,2025年後新模型與在港可用模型仍有系統性空白

延伸閱讀:Grok與Claude 2026:Benchmark、任務強項與香港可用性

廣東話AI粵語LLM評估HKCanto-Eval香港用戶

廣東話是香港的主要口語,也是香港書面語的重要組成部分,但在AI語言能力的學術研究中,它長期處於相對邊緣的位置——大多數模型評估以普通話或英語為主,粵語的系統性測試數據相對稀少,而現有數據中,部分性能最佳的模型在香港又面臨訪問限制。

現有研究的覆蓋範圍

目前對LLM粵語能力的系統性評估主要依賴三份學術文件:

各任務類型的模型表現(2024年數據)

根據2024年研究:

所有受測模型在英語的表現均優於粵語,粵語為相對弱項。需注意,上述數據基於2024年研究,2025至2026年代際更新後需重新評估。DeepSeek、Grok等後發模型未在上述已知研究中進行粵語專項評估。

三種粵語文字類型的區分

理解AI粵語能力需區分三種不同的文字形態:

已記錄的常見錯誤

繁簡混用:未明確要求繁體中文時,部分模型輸出夾雜簡體字;普通話化語法:以普通話句式及助詞回應粵語輸入;粵語專用字識別:「霸」「𠮶」「嗰」「咋」等專用字在較小模型中容易出錯;中英夾雜處理:大型模型整體可行,但一致性有差異。

香港用戶面對的可用性矛盾

現有數據顯示粵語能力最強的模型(GPT-4o、Claude)在香港面臨訪問限制;在港可自由使用的模型(Grok、DeepSeek/Qwen)缺乏系統性粵語Benchmark記錄;Gemini(Google)在港可用,在中文語境有一定優勢,但粵語專項數據同樣有限。

小結

粵語AI能力的研究現況是:有學術框架、有部分數據、但存在系統性空白(尤其是2025年後新模型及在港可用模型的評估)。實際選型建議以業務對話的真實測試集評估,而非依賴模型的整體語言能力聲稱——「支援中文」不等於「適合香港粵語語境」。

雙語文件檢索的工程問題,可參閱你份文件一半中文一半英文——大多數AI系統就係喺呢度跌倒;繁體中文寫作的提示策略,可參閱AI輔助繁體中文寫作:常見錯誤、提示策略與工具選擇;混合語境下的嵌入模型測試,可參閱向量嵌入選型:如何為生產RAG選擇合適的嵌入模型。

Levi係駐香港嘅獨立AI工程師,專注生產級LLM應用、RAG pipeline及企業AI合規架構。如需進一步討論本文涉及的議題,歡迎洽詢。

WhatsApp 免費初步評估 → 查看更多企業案例 →

或以電郵聯絡:support@hksoka.com