✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

Token 边界的代价:压缩证书与预测

事件

预分词限制了哪些文本片段能成为预测单元,但当分词器只在相同边界下比较时,这种压缩代价就被掩盖了。研究者通过从两侧界定最小 token 数来衡量该代价,分别在有和没有正则表达式边界规则的情况下进行。对 token 出现赋予非负价格,可通过最短路径和词表预算选择得到下界;对所有价格取最大值可恢复线性规划松弛,并由独立的整数检查器验证报告值。在英文维基百科上,边界使最优 token 数增加 28.3%–36.8%。字节对编码比受限下界高 2.1%,但比无限制下界高 10.9%。

压缩与预测偏好不同的词典:在 8500 万非嵌入参数和匹配训练 token 预算下,无限制拟合在配对研究的全部 12 种语言中,于共同的无限制解码器下取得更高的平均留出比特每字节;在独立调参和评估下,12 种语言中有 11 种如此。为研究中间边界策略,研究者引入边界许可证,限制允许跨越切分的词表条目,并支持同形式的证书。在单独的英文和中文拟合语料上,许可 10% 的词表预算即可分别恢复移除所有切分所实现 token 数减少量的 85.2% 和 100.0%。这些结果量化了边界的压缩代价,同时将其与所得 token 单元的预测质量区分开来。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:arXiv cs.AI*

📎 原始来源:arXiv cs.AI
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容