Model Details
Model Description
このモデルは、ハリー・ポッターシリーズなどに登場する架空の言語「パーセルタング(蛇語)」風の文章を自動生成するテキスト生成モデルです。
英語の軽量モデルである gpt2 をベースに、蛇の摩擦音(sss, sha, has など)の法則性を再現した独自のデータセットを用いてファインチューニングを行いました。
- Model type: Causal Language Model (テキスト生成)
- Language(s): Parseltongue (Alphabet-based)
- Finetuned from model:
gpt2
Uses
Direct Use
架空の言語による神秘的・不気味なテキスト表現を生成し、ゲームやロールプレイ、世界観の演出などに活用できます。
Out-of-Scope Use
このモデルは「蛇語らしい文字列の並び(確率的パターン)」を学習したものであり、日本語や英語など実在の言語を蛇語に「翻訳」する機能は持っていません。
How to Get Started with the Model
以下のPythonコードを使用して、モデルを読み込み、蛇語を生成することができます。
from transformers import AutoTokenizer, AutoModelForCausalLM
model_name = "RS-poke/parseltongue-gpt2"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name)
input_text = "Sss"
inputs = tokenizer(input_text, return_tensors="pt")
outputs = model.generate(
inputs.input_ids,
max_length=50,
num_return_sequences=3,
no_repeat_ngram_size=2,
do_sample=True,
top_k=50,
pad_token_id=tokenizer.eos_token_id
)
for i, output in enumerate(outputs):
print(tokenizer.decode(output, skip_special_tokens=True))
Training Details
Training Data
モデルの学習には、パーセルタング特有の音節パターンを組み合わせてランダム生成した、5,000行の独自コーパス(ダミーテキスト)を使用しています。
Bias, Risks, and Limitations
ベースモデルである gpt2 の既存のトークナイザ(単語辞書)をそのまま使用しているため、架空言語特有の単語の区切り方をAIが完全に認識できていない可能性があります。より精度の高い架空言語モデルを作成するためには、独自のトークナイザの構築が推奨されます。
メモ
- モデルの名前に間違いがあったため、修正 [2026/07/17]