Tiammomo

大模型算法

围绕 Tokenizer、学习范式、数据治理、预训练、监督微调、偏好对齐和蒸馏,解释模型能力如何被训练出来。

7 个主题 Tokenizer 数据训练 微调对齐 能力压缩

专题导航

四条线拆分成独立页面,当前页面只展示“大模型算法”专题内的完整图解。

返回写作中心 →
Line 04

大模型算法

围绕 Tokenizer、学习范式、数据治理、预训练、监督微调、偏好对齐和蒸馏,解释模型能力如何被训练出来。

7 个主题 Tokenizer 数据训练 微调对齐 能力压缩
Tokenizer 分词器高密度幻想风知识地图
大模型算法 · Tokenizer

Tokenizer:分词器

理解 BPE、SentencePiece、词表、特殊 token、多语言、代码数字、上下文成本和 tokenizer 版本兼容。

文章待补充
强化学习 Reinforcement Learning 高密度幻想风知识地图
大模型算法 · Reinforcement Learning

强化学习:奖励驱动的学习

把 Agent、环境、状态、动作、奖励、价值函数、策略梯度、Actor-Critic 和 RLHF 统一起来看。

文章待补充
LLM Data Curation 训练数据治理高密度幻想风知识地图
大模型算法 · Data

Data Curation:训练数据治理

从数据采集、清洗去重、质量过滤、配比、版权安全、版本审计和数据回流理解大模型数据工程。

文章待补充
LLM Pretraining 预训练流水线高密度幻想风知识地图
大模型算法 · Pretraining

LLM Pretraining:预训练流水线

从数据清洗、Tokenizer、训练目标、分布式并行、损失监控、checkpoint 和评测理解基础模型如何炼成。

文章待补充
SFT PEFT LoRA 监督微调高密度幻想风知识地图
大模型算法 · Fine-tuning

SFT / PEFT:监督微调与 LoRA

理解指令数据、SFT、LoRA、QLoRA、训练超参、过拟合风险、评测和 adapter 发布流程。

文章待补充
Alignment RLHF DPO 偏好对齐高密度幻想风知识地图
大模型算法 · Alignment

Alignment:偏好对齐与安全训练

梳理偏好数据、奖励模型、RLHF、DPO、RLAIF、安全对齐、过度拒答和对齐评测。

文章待补充
LLM Distillation 模型蒸馏高密度幻想风知识地图
大模型算法 · Distillation

Distillation:模型蒸馏

从 teacher/student、数据构造、软标签、步骤蒸馏、偏好蒸馏、质量评估和部署取舍理解能力迁移。

文章待补充