← 企业洞察
繁體中文 English 简体中文
Levi · LinkedIn · 2026-09-25

粤语AI能力2026:研究数据、模型差异与香港用户的实际选择

粤语AI能力有学术框架与部分数据,2025年后新模型与在港可用模型仍有系统性空白

延伸阅读:Grok与Claude 2026:Benchmark、任务强项与香港可用性

粤语AI粤语LLM评估HKCanto-Eval香港用户

粤语是香港的主要口语,也是香港书面语的重要组成部分,但在AI语言能力的学术研究中,它长期处于相对边缘的位置——大多数模型评估以普通话或英语为主,粤语的系统性测试数据相对稀少,而现有数据中,部分性能最佳的模型在香港又面临访问限制。

现有研究的覆盖范围

目前对LLM粤语能力的系统性评估主要依赖三份学术文件:

各任务类型的模型表现(2024年数据)

根据2024年研究:

所有受测模型在英语的表现均优于粤语,粤语为相对弱项。需注意,上述数据基于2024年研究,2025至2026年代际更新后需重新评估。DeepSeek、Grok等后发模型未在上述已知研究中进行粤语专项评估。

三种粤语文字类型的区分

理解AI粤语能力需区分三种不同的文字形态:

已记录的常见错误

繁简混用:未明确要求繁体中文时,部分模型输出夹杂简体字;普通话化语法:以普通话句式及助词回应粤语输入;粤语专用字识别:「霸」「𠮶」「嗰」「咋」等专用字在较小模型中容易出错;中英夹杂处理:大型模型整体可行,但一致性有差异。

香港用户面对的可用性矛盾

现有数据显示粤语能力最强的模型(GPT-4o、Claude)在香港面临访问限制;在港可自由使用的模型(Grok、DeepSeek/Qwen)缺乏系统性粤语Benchmark记录;Gemini(Google)在港可用,在中文语境有一定优势,但粤语专项数据同样有限。

小结

粤语AI能力的研究现况是:有学术框架、有部分数据、但存在系统性空白(尤其是2025年后新模型及在港可用模型的评估)。实际选型建议以业务对话的真实测试集评估,而非依赖模型的整体语言能力声称——「支持中文」不等于「适合香港粤语语境」。

双语文档检索的工程问题,可参阅文档一半中文一半英文——大多数AI系统就是在这里跌倒;繁体中文写作的提示策略,可参阅AI辅助繁体中文写作:常见错误、提示策略与工具选择;混合语境下的嵌入模型测试,可参阅向量嵌入选型:如何为生产RAG选择合适的嵌入模型。

Levi是驻香港的独立AI工程师,专注生产级LLM应用、RAG pipeline及企业AI合规架构。如需进一步讨论本文涉及的议题,欢迎咨询。

查看更多企业案例 →

微信:freedom_from_gold 或邮件:support@hksoka.com