廣東話AI能力2026:研究數據、模型差異與香港用戶的實際選擇
粵語AI能力有學術框架與部分數據,2025年後新模型與在港可用模型仍有系統性空白
延伸閱讀:Grok與Claude 2026:Benchmark、任務強項與香港可用性
廣東話是香港的主要口語,也是香港書面語的重要組成部分,但在AI語言能力的學術研究中,它長期處於相對邊緣的位置——大多數模型評估以普通話或英語為主,粵語的系統性測試數據相對稀少,而現有數據中,部分性能最佳的模型在香港又面臨訪問限制。
現有研究的覆蓋範圍
目前對LLM粵語能力的系統性評估主要依賴三份學術文件:
- arXiv:2408.16756(2024年8月):系統評估主流LLM在粵語任務中的表現,覆蓋事實生成、數學邏輯、複雜推理及一般知識四個維度。
- HKCanto-Eval(arXiv:2503.12440,2025年3月):專為評估LLM在粵語理解及香港文化認知設計的Benchmark,聚焦HK特定語境。
- Measuring HK MMLU(arXiv:2505.02177,2025年5月):以香港情境為基礎的類MMLU格式評估。
各任務類型的模型表現(2024年數據)
根據2024年研究:
- 數學邏輯:GPT-4、GPT-4o、Claude-3.5表現最佳,其後為Mixtral-large-2、Llama-3.1-70b、GLM-4
- 複雜推理:GPT-4和GPT-4o一貫最佳,緊隨其後為Qwen-2.5-72b、Claude-3.5
- 一般知識(MMLU類):Qwen-2.5-72b表現一貫最佳
- 事實生成:Qwen-1.5-110b和Mixtral-large-2領先
所有受測模型在英語的表現均優於粵語,粵語為相對弱項。需注意,上述數據基於2024年研究,2025至2026年代際更新後需重新評估。DeepSeek、Grok等後發模型未在上述已知研究中進行粵語專項評估。
三種粵語文字類型的區分
理解AI粵語能力需區分三種不同的文字形態:
- 書面語(正式繁體中文):LLM整體處理最佳,但常出現港式與台式繁體的詞匯混淆(的士vs計程車、地鐵vs捷運)。
- 書面廣東話(含「佢、喺、唔、嘅、囉、咁」等粵語專用字):處理能力因模型而異,部分模型在收到書面粵語輸入時,以正式書面語(普通話語序)回覆而非維持粵語風格。
- 口語粵語羅馬拼音:現有LLM表現最弱,TTS語調對粵語常不準確。
已記錄的常見錯誤
繁簡混用:未明確要求繁體中文時,部分模型輸出夾雜簡體字;普通話化語法:以普通話句式及助詞回應粵語輸入;粵語專用字識別:「霸」「𠮶」「嗰」「咋」等專用字在較小模型中容易出錯;中英夾雜處理:大型模型整體可行,但一致性有差異。
香港用戶面對的可用性矛盾
現有數據顯示粵語能力最強的模型(GPT-4o、Claude)在香港面臨訪問限制;在港可自由使用的模型(Grok、DeepSeek/Qwen)缺乏系統性粵語Benchmark記錄;Gemini(Google)在港可用,在中文語境有一定優勢,但粵語專項數據同樣有限。
小結
粵語AI能力的研究現況是:有學術框架、有部分數據、但存在系統性空白(尤其是2025年後新模型及在港可用模型的評估)。實際選型建議以業務對話的真實測試集評估,而非依賴模型的整體語言能力聲稱——「支援中文」不等於「適合香港粵語語境」。
雙語文件檢索的工程問題,可參閱你份文件一半中文一半英文——大多數AI系統就係喺呢度跌倒;繁體中文寫作的提示策略,可參閱AI輔助繁體中文寫作:常見錯誤、提示策略與工具選擇;混合語境下的嵌入模型測試,可參閱向量嵌入選型:如何為生產RAG選擇合適的嵌入模型。
Levi係駐香港嘅獨立AI工程師,專注生產級LLM應用、RAG pipeline及企業AI合規架構。如需進一步討論本文涉及的議題,歡迎洽詢。
WhatsApp 免費初步評估 → 查看更多企業案例 →或以電郵聯絡:support@hksoka.com