加载中...
avatar
文章
62
标签
84
分类
12
Home
Archives
Categories
Tags
About
LogoTeachCraft BlogBPE & BBPE & wordpiece & ULM 返回首页
搜索
Home
Archives
Categories
Tags
About

BPE & BBPE & wordpiece & ULM

发表于2026-02-20|更新于2026-02-20|大模型LLM
|总字数:0|阅读时长:1分钟|浏览量:
文章作者: Wang Tao
文章链接: https://www.loveww.top/2026/02/20/05-%E5%A4%A7%E6%A8%A1%E5%9E%8BLLM/BPE%20&%20BBPE%20&%20wordpiece%20&%20ULM/
版权声明: 本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 TeachCraft Blog!
大模型LLM分词算法
上一篇
transformer 模型随笔
随便记录自己想到的问题,自问自答,后续会整理整个transformer 模型的原理及其复现 问题: 在transformer中每个功能层添加add & norm 层的原因 batch norm, layer norm 原理及其区别,以及使用场景 为什么transformer中使用layer norm 而不是 batch norm 对于输入的句子长度不一,如何处理?
下一篇
Unigram Language Model (ULM)
Ulm 分词算法(通常指 ULM, Unsupervised Language Modeling 分词,或与 SentencePiece 中的 Unigram 语言模型算法高度相关)是一种基于统计概率的子词(Subword)分词算法。 与传统的结巴分词(基于词典)或简单的 BPE(基于频次合并)不同,ULM 的核心逻辑是:从一个巨大的候选词表出发,通过概率模型不断“剔除”对整体语言模型贡献度低的词,直到达到目标词表大小。 1. 原理详解ULM 算法建立在假设:一个句子 $S$ 的分词序列 $x = (x_1, x_2, …, x_n)$ 的概率等于各子词概率的乘积: $$ P(x) = \prod_{i=1}^{n} P(x_i)$$ 核心步骤: 初始化:生成一个非常大的初始词表(例如:所有出现的字符 + 频繁出现的子串)。 期望最大化 (EM 训练): E-Step:在当前词表下,利用维特比算法 (Viterbi) 找到语料库中最优的分词路径。 M-Step:根据分词结果更新词表中每个词的出现概率 $P(x_i)$。 计算损失 (Loss):...
相关推荐
2026-02-20
分词算法BPE
Byte Pair Encoding (BPE) 概念及其原理 简介Byte Pair Encoding (BPE) 是 NLP 中最重要的编码方式之一,它的有效性已被 GPT-2、RoBERTa、XLM、FlauBERT 等强大的语言模型所证实。 初识 BPEBPE 是一种简单的数据压缩算法,它在 1994 年发表的文章”A New Algorithm for Data Compression”中被首次提出。 核心思想 BPE 每一步都将最常见的一对相邻数据单位替换为该数据中没有出现过的一个新单位,反复迭代直到满足停止条件。 压缩示例假设我们有需要编码(压缩)的数据 aaabdaaabac。 相邻字节对 aa 最常出现,用新字节 Z 替换 结果:ZabdZabac,其中 Z = aa 下一个常见字节对是 ab,用 Y 替换 结果:ZYdZYac,其中 Z = aa,Y = ab 继续递归编码 ZY 为 X 最终结果:XdXac,其中 X = ZY,Y = ab,Z = aa 无法进一步压缩,因为没有重复出现的字节对 解码:反向执行以上过程即可还...
2026-02-20
Unigram Language Model (ULM)
Ulm 分词算法(通常指 ULM, Unsupervised Language Modeling 分词,或与 SentencePiece 中的 Unigram 语言模型算法高度相关)是一种基于统计概率的子词(Subword)分词算法。 与传统的结巴分词(基于词典)或简单的 BPE(基于频次合并)不同,ULM 的核心逻辑是:从一个巨大的候选词表出发,通过概率模型不断“剔除”对整体语言模型贡献度低的词,直到达到目标词表大小。 1. 原理详解ULM 算法建立在假设:一个句子 $S$ 的分词序列 $x = (x_1, x_2, …, x_n)$ 的概率等于各子词概率的乘积: $$ P(x) = \prod_{i=1}^{n} P(x_i)$$ 核心步骤: 初始化:生成一个非常大的初始词表(例如:所有出现的字符 + 频繁出现的子串)。 期望最大化 (EM 训练): E-Step:在当前词表下,利用维特比算法 (Viterbi) 找到语料库中最优的分词路径。 M-Step:根据分词结果更新词表中每个词的出现概率 $P(x_i)$。 计算损失 (Loss):...
2026-02-20
WordPiece 分词算法原理
WordPiece 分词算法 Google BERT 的核心分词技术 简介WordPiece 是 Google 在 2016 年为了解决神经机器翻译问题提出的分词算法,后来因为成为了 BERT 的默认分词方案而彻底走红。自此之后,很多基于 BERT 的 Transformer 模型都复用了这种方法,比如 DistilBERT、MobileBERT、Funnel Transformers 和 MPNET。 初识 WordPiece如果说 BPE 是单纯的统计学家(看数量),那么 WordPiece 就像是一个概率学家(看概率)。 核心思想 WordPiece 的核心目标:最大化训练数据的似然概率 与 BPE 的贪心合并策略不同,WordPiece 采用概率模型来选择如何合并子词。 WordPiece vs BPE:核心区别 维度 BPE WordPiece 合并逻辑 统计最频繁的字节对 最大化训练数据似然概率 选择标准 频率最高 最大化似然增量(PMI) 子词标记 词首加 Ġ (GPT 风格) 非词首加 ## 分词策略 贪心匹配 最长匹配 应用模...
2026-02-25
transformer 模型随笔
随便记录自己想到的问题,自问自答,后续会整理整个transformer 模型的原理及其复现 问题: 在transformer中每个功能层添加add & norm 层的原因 batch norm, layer norm 原理及其区别,以及使用场景 为什么transformer中使用layer norm 而不是 batch norm 对于输入的句子长度不一,如何处理?

评论
avatar
Wang Tao
🤖 机器人与自动驾驶 👁️ 计算机视觉 (2D/3D检测·分割) 🔬 深度学习算法 📡 点云处理 🧠 大模型技术
文章
62
标签
84
分类
12
Follow Me
公告
欢迎来到我的博客!这里记录了我的技术学习笔记和项目经验。欢迎一起交流学习!✨
最新文章
0. 基本数学:三个小工具2026-08-16
1. SLAM是什么:盲人摸象与边走边画2026-08-16
2. 机器人眼中的世界:传感器与栅格地图2026-08-16
3. 粒子滤波:一千个分身猜位置2026-08-16
4. RBPF:把鸡蛋问题拆开2026-08-16
© 2025 - 2026 By Wang Tao框架 Hexo 7.3.0|主题 Butterfly 5.5.0
搜索
数据加载中