大语言模型是怎么"理解"人类语言的

📅 📂 文章

AI不"理解"语言,它"预测"语言

ChatGPT、DeepSeek这些大语言模型,本质上都在做一件事:根据前面的文字,预测下一个最可能出现的词。

听起来简单,但当模型足够大、数据足够多时,"预测下一个词"就涌现出了"理解"的能力。

攻:3个核心概念

1. Token(词元)。AI不读"字",读Token。一个Token大约是1-2个汉字或3-4个英文字母。"人工智能"≈2个Token。模型的上下文窗口按Token计算——GPT-4的窗口是128K Token,约10万字。

2. Transformer架构。2017年Google发明的神经网络架构,是所有大语言模型的基础。核心创新:"注意力机制"——让模型在处理每个词时,能"看到"前面所有的词,判断哪些词对当前预测最重要。

3. 涌现能力。模型参数达到一定规模后,突然展现出小模型没有的能力——推理、创作、编程。就像水到100°C突然沸腾,量变引起质变。

守:3个常见误解

1. "AI有意识"。没有。AI是数学模型,不是生命体。它能模拟理解,但不真正理解。

2. "AI不会犯错"。AI会"幻觉"——一本正经地胡说八道。重要信息必须人工验证。

3. "AI会取代所有人"。AI取代的是"任务",不是"职业"。你的职业由很多任务组成,AI只能替代其中一部分。

终极利他

理解AI不是为了成为技术专家,是为了在这个时代做出正确的判断——哪些该信任AI,哪些该保持警惕。

意识自由:理解技术的本质,才能不被技术裹挟。

AI 大语言模型 Transformer 科普