Downloads · 30 days
23
28% of all-time downloads
tokimoa/jp-invoice-reader-2b
jp-invoice-reader-2b is a image-text-to-text model from tokimoa. Use it for the image-text-to-text task on the model card, and read the license before you ship it in a product. It is set up for mlx. The card lists the license as apache-2.0.
Qwen3-VL-2B-Instructを合成日本語帳票データ(GT既知方式)でLoRA post-trainingした、tokimoa初の自作派生モデルです。請求書・見積書・納品書・領収書の読み取り(QA・構造化JSON抽出)に特化しています。LoRA融合済みの単体モデル(4.0GB)で、そのままload()で動きます。
Downloads · 30 days
23
28% of all-time downloads
All-time downloads
83
Public
Parameters
2.1B
4.3 GB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors4.3 GB · 100%
From the Hugging Face model README
Qwen3-VL-2B-Instructを合成日本語帳票データ(GT既知方式)でLoRA post-trainingした、tokimoa初の自作派生モデルです。請求書・見積書・納品書・領収書の読み取り(QA・構造化JSON抽出)に特化しています。LoRA融合済みの単体モデル(4.0GB)で、そのままload()で動きます。
設計思想: ベースの2B VLMは帳票の数値は読めるのに「請求元を聞くと宛先を答える」「表参照で回避回答する」など応答行動が未調教でした(実測で特定)。訓練データは自作ジェネレータで合成し(画像を自分で生成するのでGTが完全に既知)、この行動を狙い撃ちで矯正しています。
| 構成 | ja-docs QA | 帳票QA | 抽出フィールド |
|---|---|---|---|
| ベース(Qwen3-VL-2B 4bit) | 5/6 | 52.7% | 0.3% |
| このモデル(fused bf16) | 6/6 | 93.5% | 90.1% |
from mlx_vlm import load, generate
from mlx_vlm.prompt_utils import apply_chat_template
from mlx_vlm.utils import load_config
repo = "tokimoa/jp-invoice-reader-2b"
model, processor = load(repo)
config = load_config(repo)
prompt = apply_chat_template(processor, config, "この帳票から主要項目を抽出してJSONで出力してください。", num_images=1)
out = generate(model, processor, prompt, image=["invoice.png"], max_tokens=600, temperature=0.0)
print(out.text)
Qwen/Qwen3-VL-2B-Instruct(Apache-2.0)スキャン・スマホ撮影を模した劣化を同一評価セットに適用して実測しました(各条件30枚: QA120問・抽出210フィールド。劣化はGT不変の後段画像変換で、スキャン風=紙色・照明ムラ・微回転・JPEG再圧縮、スマホ撮影風=透視歪み・影・ブラー・強めのJPEG)。
| 入力条件 | ja-docs QA | 帳票QA | 抽出フィールド |
|---|---|---|---|
| クリーン | 6/6 | 95.0% | 89.5% |
| スキャン風劣化 | 6/6 | 94.2% | 85.7% |
| スマホ撮影風劣化 | 6/6 | 91.7% | 80.0% |
スキャナ経由の帳票はクリーン比4pt以内の低下で、そのまま実用域です。スマホ撮影は抽出が約10pt下がり、誤りは明細行・税額など小さい文字に集中します。撮影入力で使う場合は正対・影を避けた撮影が効きます。
Apache-2.0(ベースモデルに準拠)
Built with a synthetic-data pipeline where ground truth is known by construction — 検証方法・データ製法の詳細は追って技術記事で公開予定です。