Token 边界的代价:压缩证书与预测
事件
预分词限制了哪些文本片段能成为预测单元,但当分词器只在相同边界下比较时,这种压缩代价就被掩盖了。研究者通过从两侧界定最小 token 数来衡量该代价,分别在有和没有正则表达式边界规则的情况下进行。对 token 出现赋予非负价格,可通过最短路径和词表预算选择得到下界;对所有价格取最大值可恢复线性规划松弛,并由独立的整数检查器验证报告值。在英文维基百科上,边界使最优 token 数增加 28.3%–36.8%。字节对编码比受限下界高 2.1%,但比无限制下界高 10.9%。
压缩与预测偏好不同的词典:在 8500 万非嵌入参数和匹配训练 token 预算下,无限制拟合在配对研究的全部 12 种语言中,于共同的无限制解码器下取得更高的平均留出比特每字节;在独立调参和评估下,12 种语言中有 11 种如此。为研究中间边界策略,研究者引入边界许可证,限制允许跨越切分的词表条目,并支持同形式的证书。在单独的英文和中文拟合语料上,许可 10% 的词表预算即可分别恢复移除所有切分所实现 token 数减少量的 85.2% 和 100.0%。这些结果量化了边界的压缩代价,同时将其与所得 token 单元的预测质量区分开来。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*