SIP-med-LLM/SIP-jmed-llm-3-13b-OP-32k-R0.1
2
3 commits
1 linked in READMEs
updated Mar 7, 2026
このモデルは、戦略的イノベーション創造プログラム(SIP)第 3 期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」において研究開発された、研究用途限定・商用利用不可の医療特化型 LLM です。
このモデルは「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」における研究開発プロトタイプとして開発されました。現段階では研究開発目的のみでの使用を想定しており、実際の臨床現場における疾患の診断や臨床意思決定支援として直接利用することは推奨されません。
本モデルは以下のデータセットを用いて、ベースモデルを追加事前学習することにより開発されました:
追加事前学習用データセットとして、主に以下の内容からなる医療系コーパス(トークン数 78.3B)を用いました。
上記の医療系コーパスから、目的とするコンテクスト長に合わせてサンプリングしたサブセットを用いて、コンテクスト長を 4096 から 32,768 まで段階的に拡張するための追加事前学習を実施しました。
追加事前学習の後、以下のデータセットを用いた指示チューニングも実施されています。
import torch
from transformers import AutoTokenizer, AutoModelForCausalLM
tokenizer = AutoTokenizer.from_pretrained("llm-jp/llm-jp-3-13b-instruct")
model = AutoModelForCausalLM.from_pretrained("SIP-med-LLM/SIP-jmed-llm-3-13b-OP-32k-R0.1", device_map="auto", torch_dtype=torch.bfloat16)
chat = [
{"role": "system", "content": "以下は、タスクを説明する指示です。要求を適切に満たす応答を書きなさい。"},
{"role": "user", "content": "心筋梗塞の主要な症状を教えて下さい。"},
]
tokenized_input = tokenizer.apply_chat_template(chat, add_generation_prompt=True, tokenize=True, return_tensors="pt").to(model.device)
with torch.no_grad():
output = model.generate(
tokenized_input,
max_new_tokens=100,
do_sample=True,
top_p=0.95,
temperature=0.7,
repetition_penalty=1.05,
)[0]
print(tokenizer.decode(output))
トークナイザーなどの詳細な技術仕様については、llm-jp/llm-jp-3.1-13bのページを参照してください。
3 commits
SIP-med-LLM/SIP-jmed-llm-3-13b-OP-32k-R0.1
2
3 commits
1 linked in READMEs
updated Mar 7, 2026
このモデルは、戦略的イノベーション創造プログラム(SIP)第 3 期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」において研究開発された、研究用途限定・商用利用不可の医療特化型 LLM です。
このモデルは「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」における研究開発プロトタイプとして開発されました。現段階では研究開発目的のみでの使用を想定しており、実際の臨床現場における疾患の診断や臨床意思決定支援として直接利用することは推奨されません。
本モデルは以下のデータセットを用いて、ベースモデルを追加事前学習することにより開発されました:
追加事前学習用データセットとして、主に以下の内容からなる医療系コーパス(トークン数 78.3B)を用いました。
上記の医療系コーパスから、目的とするコンテクスト長に合わせてサンプリングしたサブセットを用いて、コンテクスト長を 4096 から 32,768 まで段階的に拡張するための追加事前学習を実施しました。
追加事前学習の後、以下のデータセットを用いた指示チューニングも実施されています。
import torch
from transformers import AutoTokenizer, AutoModelForCausalLM
tokenizer = AutoTokenizer.from_pretrained("llm-jp/llm-jp-3-13b-instruct")
model = AutoModelForCausalLM.from_pretrained("SIP-med-LLM/SIP-jmed-llm-3-13b-OP-32k-R0.1", device_map="auto", torch_dtype=torch.bfloat16)
chat = [
{"role": "system", "content": "以下は、タスクを説明する指示です。要求を適切に満たす応答を書きなさい。"},
{"role": "user", "content": "心筋梗塞の主要な症状を教えて下さい。"},
]
tokenized_input = tokenizer.apply_chat_template(chat, add_generation_prompt=True, tokenize=True, return_tensors="pt").to(model.device)
with torch.no_grad():
output = model.generate(
tokenized_input,
max_new_tokens=100,
do_sample=True,
top_p=0.95,
temperature=0.7,
repetition_penalty=1.05,
)[0]
print(tokenizer.decode(output))
トークナイザーなどの詳細な技術仕様については、llm-jp/llm-jp-3.1-13bのページを参照してください。
3 commits