AI 大模型的语言不平等:英语最便宜,其它语言要贵得多

人工智能
词元化模型(即人工智能公司将用户输入转换为计算成本的方式)意味着,除了英语之外的其他语言使用和训练模型要贵得多。这是因为像中文这样的语言有着不同、更复杂的结构(无论是从语法还是字符数量上),导致它们需要更高的词元化率。

7 月 31 日消息,用户所使用的语言对于大型语言模型(LLM)的费用有很大的影响,可能造成英语使用者和其它语言使用者之间的人工智能鸿沟。最近的一项研究显示,由于 OpenAI 等服务所采用的的服务器成本衡量和计费的方式,英语输入和输出的费用要比其他语言低得多,其中简体中文的费用大约是英语的两倍,西班牙语是英语的 1.5 倍,而缅甸的掸语则是英语的 15 倍

IT之家注意到,推特用户 Dylan Patel(@dlan522p)分享了一张照片,展示了牛津大学进行的一项研究,该研究发现,让一个 LLM 处理一句缅甸语句子需要 198 个词元(tokens),而同样的句子用英语写只需要 17 个词元。词元代表了通过 API(如 OpenAI 的 ChatGPT 或 Anthropic 的 Claude 2)访问 LLM 所需的计算力成本,这意味着缅甸语句子使用这种服务的成本比英语句子高出 11 倍。

词元化模型(即人工智能公司将用户输入转换为计算成本的方式)意味着,除了英语之外的其他语言使用和训练模型要贵得多。这是因为像中文这样的语言有着不同、更复杂的结构(无论是从语法还是字符数量上),导致它们需要更高的词元化率。例如,根据 OpenAI 的 GPT3 分词器 ,“你的爱意(your affection)”的词元,在英语中只需要两个词元,但在简体中文中需要八个词元。尽管简体中文文本只有 4 个字符(你的爱意),而英文有 14 个字符。

责任编辑:姜华 来源: IT之家
相关推荐

2009-03-25 08:38:56

IE8浏览器微软

2022-09-01 21:38:30

加密货币区块链金融

2022-04-25 13:20:04

区块链艺术去中心

2018-06-08 16:28:23

2022-06-27 10:05:00

微软人工智能面部识别

2023-05-10 15:49:10

NLP语言模型

2020-10-20 09:45:28

Facebook AI翻译

2018-03-13 09:34:30

人工智能编程语言Python

2017-02-27 11:53:12

AI学习

2023-09-03 16:20:30

2024-03-19 13:12:36

自动驾驶模型

2024-06-06 09:47:56

2024-01-12 10:29:26

2023-03-30 19:17:54

语言编程

2013-08-23 13:35:30

编程语言程序员

2024-05-27 08:00:00

人工智能大语言模型

2023-05-09 07:09:02

2023-02-25 16:14:36

AIMeta语言模型

2022-03-16 16:07:05

区块链技术工具
点赞
收藏

51CTO技术栈公众号