粤语AI能力2026:研究数据、模型差异与香港用户的实际选择
粤语AI能力有学术框架与部分数据,2025年后新模型与在港可用模型仍有系统性空白
延伸阅读:Grok与Claude 2026:Benchmark、任务强项与香港可用性
粤语是香港的主要口语,也是香港书面语的重要组成部分,但在AI语言能力的学术研究中,它长期处于相对边缘的位置——大多数模型评估以普通话或英语为主,粤语的系统性测试数据相对稀少,而现有数据中,部分性能最佳的模型在香港又面临访问限制。
现有研究的覆盖范围
目前对LLM粤语能力的系统性评估主要依赖三份学术文件:
- arXiv:2408.16756(2024年8月):系统评估主流LLM在粤语任务中的表现,覆盖事实生成、数学逻辑、复杂推理及一般知识四个维度。
- HKCanto-Eval(arXiv:2503.12440,2025年3月):专为评估LLM在粤语理解及香港文化认知设计的Benchmark,聚焦HK特定语境。
- Measuring HK MMLU(arXiv:2505.02177,2025年5月):以香港情境为基础的类MMLU格式评估。
各任务类型的模型表现(2024年数据)
根据2024年研究:
- 数学逻辑:GPT-4、GPT-4o、Claude-3.5表现最佳,其后为Mixtral-large-2、Llama-3.1-70b、GLM-4
- 复杂推理:GPT-4和GPT-4o一贯最佳,紧随其后为Qwen-2.5-72b、Claude-3.5
- 一般知识(MMLU类):Qwen-2.5-72b表现一贯最佳
- 事实生成:Qwen-1.5-110b和Mixtral-large-2领先
所有受测模型在英语的表现均优于粤语,粤语为相对弱项。需注意,上述数据基于2024年研究,2025至2026年代际更新后需重新评估。DeepSeek、Grok等后发模型未在上述已知研究中进行粤语专项评估。
三种粤语文字类型的区分
理解AI粤语能力需区分三种不同的文字形态:
- 书面语(正式繁体中文):LLM整体处理最佳,但常出现港式与台式繁体的词汇混淆(的士vs计程车、地铁vs捷运)。
- 书面广东话(含「佢、喺、唔、嘅、囉、咁」等粤语专用字):处理能力因模型而异,部分模型在收到书面粤语输入时,以正式书面语(普通话语序)回复而非维持粤语风格。
- 口语粤语罗马拼音:现有LLM表现最弱,TTS语调对粤语常不准确。
已记录的常见错误
繁简混用:未明确要求繁体中文时,部分模型输出夹杂简体字;普通话化语法:以普通话句式及助词回应粤语输入;粤语专用字识别:「霸」「𠮶」「嗰」「咋」等专用字在较小模型中容易出错;中英夹杂处理:大型模型整体可行,但一致性有差异。
香港用户面对的可用性矛盾
现有数据显示粤语能力最强的模型(GPT-4o、Claude)在香港面临访问限制;在港可自由使用的模型(Grok、DeepSeek/Qwen)缺乏系统性粤语Benchmark记录;Gemini(Google)在港可用,在中文语境有一定优势,但粤语专项数据同样有限。
小结
粤语AI能力的研究现况是:有学术框架、有部分数据、但存在系统性空白(尤其是2025年后新模型及在港可用模型的评估)。实际选型建议以业务对话的真实测试集评估,而非依赖模型的整体语言能力声称——「支持中文」不等于「适合香港粤语语境」。
双语文档检索的工程问题,可参阅文档一半中文一半英文——大多数AI系统就是在这里跌倒;繁体中文写作的提示策略,可参阅AI辅助繁体中文写作:常见错误、提示策略与工具选择;混合语境下的嵌入模型测试,可参阅向量嵌入选型:如何为生产RAG选择合适的嵌入模型。
Levi是驻香港的独立AI工程师,专注生产级LLM应用、RAG pipeline及企业AI合规架构。如需进一步讨论本文涉及的议题,欢迎咨询。
查看更多企业案例 →微信:freedom_from_gold 或邮件:support@hksoka.com