知识图谱
大语言模型概览
大模型通过预训练和微调获得强大的语言理解与生成能力,代表模型包括 GPT、BERT、LLaMA 等。
核心
概念
方法
应用
🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
😲
反直觉2017年Transformer问世时,没人预见它会引发大模型革命。短短几年内,参数量从百万(GPT-1)飙升到万亿(GPT-4),催生了"缩放定律"——性能随参数量、数据量、算力呈幂律增长,这条经验规律至今没有见顶的迹象。
一句话总结
💡
大语言模型通过在海量文本上预训练超大规模 Transformer,展现出涌现的通用语言理解与生成能力。
常见误区
这些坑别踩
✗
误区 1
模型越大一定越聪明。
✓
正确理解
规模带来能力提升但受数据质量、训练方法影响,盲目增大未必更好。
✗
误区 2
大模型是"查数据库"。
✓
正确理解
大模型是参数化的概率模型,生成是基于学到的分布预测,而非检索原文。
✗
误区 3
涌现能力有清晰阈值。
✓
正确理解
涌现能力的定义和触发点存在争议,并非在某参数量突变。
巩固练习
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
1
大语言模型(LLM)通常采用的训练范式是?
2
大模型的"涌现能力"(Emergent Abilities)通常指?
3
LLM 出现"幻觉"(Hallucination)是指?
4
降低大模型推理成本的常用技术是?
面试经典题
共 5 题 · 先思考再看答案
1
基础
什么是大语言模型?请简述其训练流程。
2
中等
请说明预训练与微调的区别,以及为什么需要微调。
3
中等
什么是大模型的幻觉?如何缓解幻觉问题?
4
困难
什么是涌现能力?它存在哪些争议?
5
困难
请解释上下文学习(ICL)和思维链(CoT),它们与大模型能力有何关系?
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺