Downloads · 30 days
0
kojikojiprg/ai-theories-tokenizer-code
ai-theories-tokenizer-code is a machine learning model from kojikojiprg. Use it for the machine learning task on the model card, and read the license before you ship it in a product. The card lists the license as cc-by-nc-4.0.
ai-theories(https://github.com/kojikojiprg/ai-theories)プロジェクトの成果物。 バイトレベル Byte Pair Encoding(BPE、語彙サイズ 8192)の スクラッチ実装によるトークナイザ。
Downloads · 30 days
0
Access
Public
Updated Sep 6, 2026
Repo size
—
Likes
0
Public
Click a slice to open those files.
.json715 KB · 99%
From the Hugging Face model README
ai-theories(https://github.com/kojikojiprg/ai-theories)プロジェクトの成果物。
バイトレベル Byte Pair Encoding(BPE、語彙サイズ 8192)の
スクラッチ実装によるトークナイザ。
研究・教育目的で構築したものであり、品質保証は行っていない。商用・実運用での利用は 想定しない。
このアーティファクトは暫定扱いである。 006. 小型 GPT の事前学習 はコードドメインで言語モデルの学習・トークナイザ条件の比較を行っておらず、コードドメイン における「正解」となる設定(方式・語彙サイズ)はまだ確立していない。将来、コードドメインで のトークナイザ比較実験が行われ、より適した設定が判明した場合はこのアーティファクトを 差し替える可能性がある。
現時点では、006 の本番実験で英語について選定された設定(バイトレベル BPE、語彙サイズ
8192、max_chunk_bytes=64)を仮採用している。
005. トークナイザ
で導入された load_code_corpus()(src/data/text.py)により取得したコーパス
(本リポジトリ自身の src/ 配下の Python ソースコードを連結したもの)から学習した。
このコーパスはリポジトリ自身の内容に依存する。 load_code_corpus() はリポジトリの
src/ を実行時点の内容で連結するため、取得結果は取得時点のリポジトリ内容に依存し、
将来のコミットでは変化しうる。取得に使ったコミットハッシュ: 05b684285b77ffd1a6b6f6fcb762cdd8e332b0d5
max_chunk_bytes): 64