stockmark/Stockmark-2-100B-Instruct

Model

Stockmark-2-100B-Instruct

12

8 commits

3 linked in READMEs

updated Sep 25, 2025

See the code

README

Stockmark-2-100B-Instruct

image/jpeg

Model description

Stockmark-2-100B-Instruct is a 100-billion-parameter large language model built from scratch, with a particular focus on Japanese. It was pre-trained on approximately 2.0 trillion tokens of data, consisting of 60% English, 30% Japanese, and 10% code. Following pretraining, the model underwent post-training (SFT and DPO) with synthetic data in Japanese to enhance its ability to follow instructions. This version improves instruction-following ability and adds support for long-context (32k), compared to the previous version (Stockmark-2-100B-Instruct-beta).

This project was supported by GENIAC.

Features

  • Model Type: Causal Language Model
  • Number of Parameters: 96B
  • Number of Layers: 86
  • Number of Attention Heads (GQA): 72 for Q and 8 for KV
  • Context Length: 32k
  • Supported Languages: Japanese and English

Model performance

Japanese MT-bench

ModelAveragecodingextractionhumanitiesmathreasoningroleplaystem
Stockmark-2-100B-Instruct7.877.078.358.737.575.458.658.33
Stockmark-2-100B-Instruct-beta7.716.738.238.637.015.858.548.07

How to use

transformers

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "stockmark/Stockmark-2-100B-Instruct"

tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name, device_map="auto", torch_dtype="bfloat16")

instruction = "自然言語処理とは?"
input_ids = tokenizer.apply_chat_template(
    [{"role": "user", "content": instruction}],
    add_generation_prompt=True,
    return_tensors="pt"
).to(model.device)

with torch.inference_mode():
  tokens = model.generate(
    input_ids,
    max_new_tokens = 512,
    do_sample = True,
    temperature = 0.7,
    top_p = 0.95
  )
    
output = tokenizer.decode(tokens[0], skip_special_tokens=True)
print(output)

vLLM

from vllm import LLM, SamplingParams

llm = LLM(
    model="stockmark/Stockmark-2-100B-Instruct",
    tensor_parallel_size=4,
    dtype="bfloat16"
)

sampling_params = SamplingParams(
    temperature=0.7,
    top_p=0.95,
    max_tokens=512
)

conversation = [{"role": "user", "content": "自然言語処理とは?"}]

outputs = llm.chat(conversation, sampling_params=sampling_params)

for output in outputs:
    generated_text = output.outputs[0].text
    print(generated_text)

Libraries used for training

License

MIT

Developed by

Stockmark Inc.

conversational
endpoints_compatible
llama
safetensors
text-generation
text-generation-inference
transformers

Contributors

omitakahiro

8 commits

stockmark/Stockmark-2-100B-Instruct

Model

Stockmark-2-100B-Instruct

12

8 commits

3 linked in READMEs

updated Sep 25, 2025

See the code

README

Stockmark-2-100B-Instruct

image/jpeg

Model description

Stockmark-2-100B-Instruct is a 100-billion-parameter large language model built from scratch, with a particular focus on Japanese. It was pre-trained on approximately 2.0 trillion tokens of data, consisting of 60% English, 30% Japanese, and 10% code. Following pretraining, the model underwent post-training (SFT and DPO) with synthetic data in Japanese to enhance its ability to follow instructions. This version improves instruction-following ability and adds support for long-context (32k), compared to the previous version (Stockmark-2-100B-Instruct-beta).

This project was supported by GENIAC.

Features

  • Model Type: Causal Language Model
  • Number of Parameters: 96B
  • Number of Layers: 86
  • Number of Attention Heads (GQA): 72 for Q and 8 for KV
  • Context Length: 32k
  • Supported Languages: Japanese and English

Model performance

Japanese MT-bench

ModelAveragecodingextractionhumanitiesmathreasoningroleplaystem
Stockmark-2-100B-Instruct7.877.078.358.737.575.458.658.33
Stockmark-2-100B-Instruct-beta7.716.738.238.637.015.858.548.07

How to use

transformers

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "stockmark/Stockmark-2-100B-Instruct"

tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name, device_map="auto", torch_dtype="bfloat16")

instruction = "自然言語処理とは?"
input_ids = tokenizer.apply_chat_template(
    [{"role": "user", "content": instruction}],
    add_generation_prompt=True,
    return_tensors="pt"
).to(model.device)

with torch.inference_mode():
  tokens = model.generate(
    input_ids,
    max_new_tokens = 512,
    do_sample = True,
    temperature = 0.7,
    top_p = 0.95
  )
    
output = tokenizer.decode(tokens[0], skip_special_tokens=True)
print(output)

vLLM

from vllm import LLM, SamplingParams

llm = LLM(
    model="stockmark/Stockmark-2-100B-Instruct",
    tensor_parallel_size=4,
    dtype="bfloat16"
)

sampling_params = SamplingParams(
    temperature=0.7,
    top_p=0.95,
    max_tokens=512
)

conversation = [{"role": "user", "content": "自然言語処理とは?"}]

outputs = llm.chat(conversation, sampling_params=sampling_params)

for output in outputs:
    generated_text = output.outputs[0].text
    print(generated_text)

Libraries used for training

License

MIT

Developed by

Stockmark Inc.

conversational
endpoints_compatible
llama
safetensors
text-generation
text-generation-inference
transformers

Contributors

omitakahiro

8 commits