为哈萨克斯坦设置 hreflang 时,第一个本能是输入 KZ。这是 ISO 3166-1 中的国家代码。语言代码来自另一个标准,ISO 639-1,哈萨克语的代码是 kk。亚美尼亚语是 hy,格鲁吉亚语是 ka,塔吉克语是 tg。没有一个与国家代码相同。
混淆的产生是因为代码相似:KZ 和 kk,AM 和 hy,GE 和 ka。这是设置 hreflang、语言切换器以及将区域设置传递给支付系统时的主要陷阱。
如何在切换器菜单中编写语言
菜单中的“Kazakh”或“Kazakh”看起来很奇怪,就像英语界面中写着“Russian”而不是“Русский”一样。
编辑网站几乎总是使用完整的本地名称。tengrinews.kz — “Қазақша / Русский / English”,khovar.tj — “Тоҷикӣ / Русский / English”,armenpress.am — “Հայերեն” 旁边是地球图标。短代码(2-3 个字符)仅在空间有限的情况下才合理:控制面板、移动菜单、紧凑型 SaaS 界面。
本地名称和缩写
每种语言单独处理
哈萨克语。不懂哈萨克语的开发者在代码中输入 K 而不是 Қ——仅仅因为俄语键盘上没有 Қ。在切换器中出现“Казакша”而不是“Қазақша”。这看起来像一个拼写错误,但从技术上讲,它是一个不同的字符串:网站搜索会中断,排序会出错。缩写“КЗ”也是不正确的,正确的是“ҚЗ”。
“Қазақша”意为“哈萨克语”——口语化的常用形式。在官方网站上,有时会写“Қазақ тілі”(哈萨克语),但在菜单中,“Қазақша”更短。比较一下:“Казак”(哥萨克人,一个人)和“Қазақ”(哈萨克民族)——第二个词无法用俄语字母书写。
吉尔吉斯语。即使在官方网站上也没有统一的标准。kabar.kg写“Кыр”,其他政府资源写“Кырг”。两种变体都是正确的。实用建议:选择一个并在整个界面中坚持使用。“Кырг”稍微更明确,如果您的菜单中有几个以“К”开头的缩写(哈萨克语、吉尔吉斯语、俄语)。
“Kыргызча”和“Кыргыз тили”都是正确的:前者更口语化(“说吉尔吉斯语”),后者更正式(“吉尔吉斯语”)。对于切换器,“Kыргызча”更常用。
亚美尼亚语。这是列表中唯一一个本地名称的选择取决于受众居住地的语言——因为亚美尼亚语有两种不同正字法的变体(维基百科):
- Հայերեն — 东亚美尼亚语。亚美尼亚的官方语言,经过改革的苏联正字法。在亚美尼亚、俄罗斯、格鲁吉亚、伊朗使用。
- Հայերէն — 西亚美尼亚语。1915年后在散居地保留的经典正字法。黎巴嫩、法国、美国、阿根廷。
区别在于一个字母:“ե”用于东部,而“է”用于西部。但词汇也不同:“飞机”在东部是“ինքնաթիռ”,在西部是“օդանաւ”。面向亚美尼亚的网站是Հայերեն。面向亚美尼亚侨民的网站是Հայերէն。两者的ISO代码都是hy,但ISO 639-3将其区分开来:hye(东部)和hyw(西部)。缩写“ՀԱՅ”来自亚美尼亚语“Հայ”(亚美尼亚人):“ՀԱ”没有第三个字母不能作为一个词来读。
塔吉克语。问题与哈萨克语相同,但立即显现:Ҷ出现在语言名称本身中。如果开发者输入“ТЧ”而不是“ТҶ”,则切换器中会出现错误。Ҷ不是“Ч”:发音更接近英语“jump”中的“j”,介于“дж”和软“ж”之间。塔吉克斯坦外交部在mfa.tj上写的是“Ҷ”。在“Тоҷикӣ”一词中,还有一个Ӣ(长“и”),它也不在俄语键盘布局中。
格鲁吉亚语。开发者经常试图将“ქართული”缩写为“Geo”或“GE”——仅仅是因为他们不知道如何在界面中使用非拉丁字体或担心渲染问题。格鲁吉亚人会立即理解这一点:“GE”被视为外国技术代码,而不是母语词。姆赫德鲁利语是一种有1600年历史的文字,独立发展。“გამარჯობა”是“你好”。即使在紧凑的界面中,也要完整地写“ქართული”。
区域设置和货币
区域设置是“语言+国家”的组合。它定义了数字和日期的格式、货币符号和排序顺序。区域设置使用语言代码而不是国家代码:kk_KZ,而不是kz_KZ。hy_AM,而不是am_AM。这与ISO 639-1的逻辑相同。
货币代码是单独的标准,ISO 4217。一些细微差别:
乌兹别克斯坦索姆是官方缩写,用小写字母和撇号书写。在界面中,通常只使用“сум”或“UZS”——这两种变体都被接受。
哈萨克斯坦和俄罗斯共享电话区号+7。如果注册表单根据电话号码自动识别国家,这将会出错:+7 701 可能是莫斯科,也可能是阿拉木图。请单独询问国家或通过IP地址识别。
格鲁吉亚有两种官方语言:格鲁吉亚语和阿布哈兹语。对于商业网站来说,这几乎从不需要,但如果项目是政府性质的或面向阿布哈兹,则需要考虑。
字体和文字
如果只连接西里尔语范围的 Google Font,亚美尼亚语和格鲁吉亚语文本将不会以所需的字体显示——浏览器将使用系统回退,页面将显得不一致。亚美尼亚语 Unicode 块是 U+0530–U+058F,格鲁吉亚语是 U+10A0–U+10FF。Google 的 Noto Sans 涵盖了两者——将其作为这些语言的备用字体连接。
大多数独联体国家使用西里尔字母,但有三个国家在苏联解体后改用拉丁字母:乌兹别克斯坦在 1993 年,阿塞拜疆在 1991 年。西里尔字母仍然出现在旧文件和老年人中,但新内容是拉丁字母。哈萨克斯坦于 2017 年开始过渡,新拼写于 2023 年获得批准。这是百年来的第三次字母表变更:阿拉伯文字,然后是 Yanalif(1930 年代的苏联拉丁字母),然后是西里尔字母,现在又是拉丁字母。
乌兹别克语不需要单独的字体——它使用标准拉丁字母加上 O'zbekcha 中的撇号。大多数拉丁字体都涵盖了这一点。只需检查字符 ʻ (U+02BB)——它并非无处不在。
亚美尼亚语和格鲁吉亚语是完全独立的系统,与西里尔字母、拉丁字母或彼此无关。亚美尼亚字母由僧侣 Mesrop Mashtots 于 405 年创建,用于翻译圣经。格鲁吉亚语 Mkhedruli 大致与此同龄。
俄语键盘上没有的字母
哈萨克语和塔吉克语包含的字母在屏幕上很容易与俄语字母混淆,但它们在技术上是不同的 Unicode 符号。网站搜索将找不到该词,排序会出错,而母语人士会立即注意到。
哈萨克语有 42 个字母——33 个标准字母加上 9 个特殊字母:Ә、Ғ、Қ、Ң、Ө、Ұ、Ү、Һ、І。塔吉克语有自己的 6 个附加字母:Ғ、Ҳ、Қ、Ҷ、Ӣ、Ӯ。
仔细观察,Қ 和 К 是不同的(Қ 的底部有一个小尾巴)——但在俄语键盘上根本没有 Қ。人们输入“Казакша”而不是“Қазақша”不是因为粗心,而是因为所需的按键不可用。或者他们从已经发生这种替换的来源复制,但没有注意到。
在语言名称和缩写中,字母实际上很重要:在“Қазақша”和“ҚЗ”中的 Қ,在“Тоҷикӣ”和“ТҶ”中的 Ҷ 和 Ӣ,在哈萨克语单词中的 І。如果您从外部来源插入文本,请检查。将可疑符号粘贴到 unicode.org 上,您会立即看到它是什么点。
常见问题
哈萨克斯坦的默认语言应该设置为俄语还是哈萨克语?
对于大多数商业网站,俄语作为默认语言更安全,特别是如果受众年龄在 35 岁以上或属于 B2B。根据 2021 年的人口普查,约 80% 的人口会说哈萨克语,约 70% 的人口会说俄语,并且他们之间有很大的重叠。对于年轻或政府受众,则使用哈萨克语。
西亚美尼亚语是否需要单独的网站版本?
仅当您有针对性地与黎巴嫩、法国或美国的亚美尼亚侨民合作时。对于面向亚美尼亚的项目,东亚美尼亚语(hye)就足够了。通用代码hy在技术上适用于两种变体。
如何为亚美尼亚语设置hreflang?
hreflang="hy" — 用于东亚美尼亚语(亚美尼亚)。对于西亚美尼亚侨民,理论上是hyw,但这是一个非标准标签,并非所有爬虫都能处理。更简单的方法是使用一个面向亚美尼亚的hy版本。
哈萨克语现在应该使用西里尔字母还是拉丁字母?
西里尔字母。官方文件流和大多数网站仍使用西里尔字母。新的拉丁语正字法于2023年获得批准,但尚未大规模过渡。情况由gov.kz监控。
为什么国家代码和语言代码不匹配——例如,亚美尼亚是AM,而亚美尼亚语是hy?
这是两个独立的标准。ISO 3166-1编码政治实体(国家),ISO 639-1编码语言实体(语言)。亚美尼亚语的hy代码来自拉丁化的“Hayastan”——亚美尼亚的自称。格鲁吉亚语的ka代码来自“Kartuli”。有些地方代码一致(ru/RU,uz/UZ),有些地方不一致(hy/AM,ka/GE,kk/KZ)。一致是巧合,不是规则。