计算机D
大语言模型
别名:LLM
大语言模型是基于深度学习的大规模自然语言处理模型,能够理解、生成和处理人类语言,常见如GPT、Gemini等。
LLM 是 Large Language Model 的缩写,中文全称是 大语言模型。
简单来说,它是一种基于深度学习(主要是 Transformer 架构)的 AI 算法,能够理解、生成和处理人类自然语言。
1. 为什么叫“大”语言模型?
它的“大”主要体现在三个维度:
- 数据量巨大: 学习了互联网上海量的文本(图书、文章、代码、对话等),动辄几万亿字。
- 参数量巨大: 模型的“大脑细胞”(权重参数)数量极多,通常在几十亿到上万亿(如 7B、70B、400B+)不等。
- 算力消耗巨大: 需要数万张高性能 GPU 芯片进行长时间的训练。
2. LLM 的本质原理是什么?
LLM 的核心本质是一个极度精准的“超级文字接龙游戏”。 它通过预训练学习概率分布:给定前面的词,预测下一个最可能出现的词是什么。因为学习了人类海量的知识和逻辑,当它不断把“最符合上下文逻辑的下一个词”接下去时,就展现出了深度理解、推理解答和创作的能力。
3. LLM 能做什么?
- 文本生成: 写文章、写邮件、创作诗歌、写故事。
- 代码编写: 生成程序代码、解释代码、Debug 排错。
- 知识问答与对话: 类似于 ChatGPT、Gemini、Claude 等 AI 助手。
- 逻辑与分析: 提取长文章摘要、做跨语言翻译、逻辑推理。
4. 常见的代表性 LLM
- 国外: OpenAI 的 GPT-4o/o1、Google 的 Gemini、Anthropic 的 Claude 3.5、Meta 的开源模型 Llama 3。
- 国内: DeepSeek、阿里通义千问(Qwen)、百度文心一言(ERNIE)、智谱清言(GLM)等。