issai/Qolda

Model

Qolda

10

7 commits

3 linked in READMEs

updated Aug 18, 2026

See the code

README

Қазақша     English

Qolda

GitHub License Paper

Introduction

Built on top of InternVL3.5 and Qwen3, Qolda is a small vision-language model designed to operate in Kazakh, Russian, and English. The model has 4.3B parameters and comprises the InternViT-300M vision encoder and MLP Projector components from InternVL3.5-4B, along with the Qwen3-4B language model. Model training was performed using the InternVL framework 💙

The name "Qolda" reflects both its design and purpose in Kazakh: "in hand" (қолда) for its compact accessibility, and "to support" (қолдау) for its assistive nature.

Evaluation

The benchmark suites and model collections are available here:

The following tables report benchmark results across the Qolda model family. Higher is better unless otherwise noted, and the best result within each row is shown in bold.

Qolda No-Think / Qolda Think · 5B / 9B / 34B = Qolda-AVL variants

Text Benchmarks

BenchmarkLanguageQolda No-Think (4B)Qolda Think (4B)Qolda-AVL-5BQolda-AVL-9BQolda-AVL-34B
MMLUKazakh58.3969.2873.0773.8981.94
English70.0376.4679.0980.9686.71
MMLU-ProKazakh40.6257.6862.2164.2873.67
English58.0966.3171.2672.6179.00
Russian47.4262.4566.7968.2976.34
GPQAKazakh31.8938.6047.9146.9758.77
English39.4645.6252.6853.3663.81
Russian32.6040.1948.7851.3459.36
ARCKazakh86.1492.3093.5994.2796.76
English94.2296.1196.9097.2998.17
Russian91.1794.1796.1196.6297.63
GSM8KKazakh73.0183.0085.7583.1790.52
English62.8590.2295.2295.8396.44
Russian84.9983.9890.9092.0494.31
MMLU-ReduxKazakh60.0672.3876.2476.9284.39
English72.9179.4082.6584.5688.11
KazCultureKazakh53.0047.4544.7556.3962.37
KazMMLUKazakh58.1166.1469.2773.0478.98
KazBenchKazakh64.2361.1261.8364.6170.05
BelebeleKazakh81.0782.9181.7084.7688.78
PIQAKazakh63.0070.0081.0078.0085.00
INCLUDEKazakh45.2046.0053.8057.2061.80
Russian59.1756.5258.1564.4970.83
KKCOPAKazakh70.0073.7976.6078.1179.60
NIS MathKazakh66.0087.8894.0093.0098.00
KazQADKazakh70.9967.4042.2865.7670.36
RAGBenchKazakh54.9566.8152.1262.9169.98

Vision Benchmarks

BenchmarkLanguageQolda No-Think (4B)Qolda Think (4B)Qolda-AVL-5BQolda-AVL-9BQolda-AVL-34B
RealWorldQAKazakh53.8648.1052.8150.0755.42
English61.5761.7067.8470.0771.76
Russian56.0857.1259.3560.3966.41
MMStarKazakh53.0859.6067.4568.8972.50
English58.4865.0470.2772.9375.93
Russian55.4859.8466.4769.4573.93
AI2DKazakh63.4866.2672.1873.3479.05
English73.9975.6179.4081.9684.55
MathVistaKazakh58.3266.3370.1772.3474.65
English63.1471.0476.7580.9482.57
MathVisionKazakh35.4144.3852.0755.7562.06
English42.0048.0554.9358.2463.90
MMBenchKazakh79.9783.8587.6989.1990.18
English83.0584.4087.8989.0190.43
OCRBenchKazakh49.8946.4930.6151.2553.97
English69.9068.7073.2077.2079.20

Model Usage

To run inference with Transformers, please follow the guidelines from InternVL.

Alternatively, to run the model via an OpenAI-compatible server, you can use lmdeploy:

pip install lmdeploy>=0.9.1

lmdeploy serve api_server issai/Qolda --server-port 23333 --tp 1 --backend pytorch

Note: Unlike the original InternVL3.5, this model requires the enable_thinking parameter to be explicitly set in the extra_body of your API calls. However, depending on the task complexity, an empty thinking response might be generated.

Then, make a standard API call:

import base64
from openai import OpenAI

client = OpenAI(api_key='YOUR_API_KEY', base_url='http://0.0.0.0:23333/v1')

def encode_image(image_path):
    with open(image_path, "rb") as image_file:
        return base64.b64encode(image_file.read()).decode('utf-8')

image_path = "./assets/eval-results-text.png"

response = client.chat.completions.create(
    model=client.models.list().data[0].id,
    messages=[{
        'role': 'user',
        'content': [
            {
                'type': 'text',
                'text': 'Берілген диаграмманың сипаттамасын бер.'
            },
            {
                'type': 'image_url',
                'image_url': {
                    'url': f'data:image/png;base64,{encode_image(image_path)}',
                },
            }
        ],
    }],
    max_tokens=8192,
    temperature=0.6,
    top_p=0.95,
    extra_body={
        "top_k": 20,
        "enable_thinking": True
    },
)

print(response.choices[0].message.content)

License

This model is licensed under the Apache License 2.0.

Citation

@article{qolda,
  author={Arystanbekov, Batyr and Nurimanov, Aspandiyar and Maxutov, Akylbek and Albrekht, Vladimir and Kuzdeuov, Askat and Varol, Huseyin Atakan},
  journal={IEEE Access}, 
  title={Qolda: A Small Vision–Language Model for the Kazakh Language}, 
  year={2026},
  volume={14},
  number={},
  pages={46392-46414},
  keywords={Computational modeling;Training;Cognition;Adaptation models;Data models;Visualization;Hardware;Benchmark testing;Multilingual;Computer architecture;Large language models;vision-language models;low-resource languages;Kazakh natural language processing;multimodal learning;small vision-language models},
  doi={10.1109/ACCESS.2026.3676919}
}

Кіріспе

InternVL3.5 және Qwen3 негізінде жасалған Qolda — қазақ, орыс және ағылшын тілдерінде жұмыс істеуге арналған шағын көру-тілдік моделі (vision-language model). Модель 4,3 млрд параметрге ие және InternVL3.5-4B моделінің InternViT-300M көру энкодері мен MLP проектор компоненттерін, сондай-ақ Qwen3-4B тілдік моделін қамтиды. Модельді оқыту InternVL фреймворкі көмегімен жүзеге асырылды 💙

"Qolda" атауы модельдің дизайны мен мақсатын қазақ тіліндегі қолда сөзінің қос мағынасы арқылы көрсетеді. Біріншісі, шағын әрі қолжетімді болуы үшін "қолда" cөзі арқылы және екіншісі, көмекші табиғаты үшін, "қолдау" мағынасы арқылы.

Бағалау

Бенчмарк жинақтары мен модель топтамалары мына сілтемелерде қолжетімді:

Төмендегі кестелерде Qolda модельдер тобы бойынша бенчмарк нәтижелері берілген.

Qolda No-Think / Qolda Think · 5B / 9B / 34B = Qolda-AVL нұсқалары

Мәтіндік бенчмарктер

BenchmarkТілQolda No-Think (4B)Qolda Think (4B)Qolda-AVL-5BQolda-AVL-9BQolda-AVL-34B
MMLUҚазақша58.3969.2873.0773.8981.94
Ағылшынша70.0376.4679.0980.9686.71
MMLU-ProҚазақша40.6257.6862.2164.2873.67
Ағылшынша58.0966.3171.2672.6179.00
Орысша47.4262.4566.7968.2976.34
GPQAҚазақша31.8938.6047.9146.9758.77
Ағылшынша39.4645.6252.6853.3663.81
Орысша32.6040.1948.7851.3459.36
ARCҚазақша86.1492.3093.5994.2796.76
Ағылшынша94.2296.1196.9097.2998.17
Орысша91.1794.1796.1196.6297.63
GSM8KҚазақша73.0183.0085.7583.1790.52
Ағылшынша62.8590.2295.2295.8396.44
Орысша84.9983.9890.9092.0494.31
MMLU-ReduxҚазақша60.0672.3876.2476.9284.39
Ағылшынша72.9179.4082.6584.5688.11
KazCultureҚазақша53.0047.4544.7556.3962.37
KazMMLUҚазақша58.1166.1469.2773.0478.98
KazBenchҚазақша64.2361.1261.8364.6170.05
BelebeleҚазақша81.0782.9181.7084.7688.78
PIQAҚазақша63.0070.0081.0078.0085.00
INCLUDEҚазақша45.2046.0053.8057.2061.80
Орысша59.1756.5258.1564.4970.83
KKCOPAҚазақша70.0073.7976.6078.1179.60
NIS MathҚазақша66.0087.8894.0093.0098.00
KazQADҚазақша70.9967.4042.2865.7670.36
RAGBenchҚазақша54.9566.8152.1262.9169.98

Визуалды бенчмарктер

BenchmarkТілQolda No-Think (4B)Qolda Think (4B)Qolda-AVL-5BQolda-AVL-9BQolda-AVL-34B
RealWorldQAҚазақша53.8648.1052.8150.0755.42
Ағылшынша61.5761.7067.8470.0771.76
Орысша56.0857.1259.3560.3966.41
MMStarҚазақша53.0859.6067.4568.8972.50
Ағылшынша58.4865.0470.2772.9375.93
Орысша55.4859.8466.4769.4573.93
AI2DҚазақша63.4866.2672.1873.3479.05
Ағылшынша73.9975.6179.4081.9684.55
MathVistaҚазақша58.3266.3370.1772.3474.65
Ағылшынша63.1471.0476.7580.9482.57
MathVisionҚазақша35.4144.3852.0755.7562.06
Ағылшынша42.0048.0554.9358.2463.90
MMBenchҚазақша79.9783.8587.6989.1990.18
Ағылшынша83.0584.4087.8989.0190.43
OCRBenchҚазақша49.8946.4930.6151.2553.97
Ағылшынша69.9068.7073.2077.2079.20

Модельді қолдану

Transformers арқылы инференсті іске қосу үшін InternVL ұсынған нұсқаулықтарды орындаңыз.

Немесе, модельді OpenAI-үйлесімді сервер арқылы іске қосу үшін lmdeploy құралын пайдалануға болады:

pip install lmdeploy>=0.9.1

lmdeploy serve api_server issai/Qolda --server-port 23333 --tp 1 --backend pytorch

Ескерту: Qolda-ның түпнұсқалық InternVL3.5-тен айырмашылығы, бұл модель API call жасаған кезде extra_body бөлігінде enable_thinking параметрінің нақты орнатылуын талап етеді. Тапсырманың күрделілігіне байланысты бос thinking жауабы қайтарылуы мүмкін.

Содан соң, стандартты API call жасаңыз:

import base64
from openai import OpenAI

client = OpenAI(api_key='YOUR_API_KEY', base_url='http://0.0.0.0:23333/v1')

def encode_image(image_path):
    with open(image_path, "rb") as image_file:
        return base64.b64encode(image_file.read()).decode('utf-8')

image_path = "./assets/eval-results-text.png"

response = client.chat.completions.create(
    model=client.models.list().data[0].id,
    messages=[{
        'role': 'user',
        'content': [
            {
                'type': 'text',
                'text': 'Берілген диаграмманың сипаттамасын бер.'
            },
            {
                'type': 'image_url',
                'image_url': {
                    'url': f'data:image/png;base64,{encode_image(image_path)}',
                },
            }
        ],
    }],
    max_tokens=8192,
    temperature=0.6,
    top_p=0.95,
    extra_body={
        "top_k": 20,
        "enable_thinking": True
    },
)

print(response.choices[0].message.content)

Лицензия

Бұл модель Apache License 2.0 бойынша лицензияланған.

Сілтеме

@article{qolda,
  author={Arystanbekov, Batyr and Nurimanov, Aspandiyar and Maxutov, Akylbek and Albrekht, Vladimir and Kuzdeuov, Askat and Varol, Huseyin Atakan},
  journal={IEEE Access}, 
  title={Qolda: A Small Vision–Language Model for the Kazakh Language}, 
  year={2026},
  volume={14},
  number={},
  pages={46392-46414},
  keywords={Computational modeling;Training;Cognition;Adaptation models;Data models;Visualization;Hardware;Benchmark testing;Multilingual;Computer architecture;Large language models;vision-language models;low-resource languages;Kazakh natural language processing;multimodal learning;small vision-language models},
  doi={10.1109/ACCESS.2026.3676919}
}

conversational
custom_code
image-text-to-text
internvl_chat
safetensors

issai/Qolda

Model

Qolda

10

7 commits

3 linked in READMEs

updated Aug 18, 2026

See the code

README

Қазақша     English

Qolda

GitHub License Paper

Introduction

Built on top of InternVL3.5 and Qwen3, Qolda is a small vision-language model designed to operate in Kazakh, Russian, and English. The model has 4.3B parameters and comprises the InternViT-300M vision encoder and MLP Projector components from InternVL3.5-4B, along with the Qwen3-4B language model. Model training was performed using the InternVL framework 💙

The name "Qolda" reflects both its design and purpose in Kazakh: "in hand" (қолда) for its compact accessibility, and "to support" (қолдау) for its assistive nature.

Evaluation

The benchmark suites and model collections are available here:

The following tables report benchmark results across the Qolda model family. Higher is better unless otherwise noted, and the best result within each row is shown in bold.

Qolda No-Think / Qolda Think · 5B / 9B / 34B = Qolda-AVL variants

Text Benchmarks

BenchmarkLanguageQolda No-Think (4B)Qolda Think (4B)Qolda-AVL-5BQolda-AVL-9BQolda-AVL-34B
MMLUKazakh58.3969.2873.0773.8981.94
English70.0376.4679.0980.9686.71
MMLU-ProKazakh40.6257.6862.2164.2873.67
English58.0966.3171.2672.6179.00
Russian47.4262.4566.7968.2976.34
GPQAKazakh31.8938.6047.9146.9758.77
English39.4645.6252.6853.3663.81
Russian32.6040.1948.7851.3459.36
ARCKazakh86.1492.3093.5994.2796.76
English94.2296.1196.9097.2998.17
Russian91.1794.1796.1196.6297.63
GSM8KKazakh73.0183.0085.7583.1790.52
English62.8590.2295.2295.8396.44
Russian84.9983.9890.9092.0494.31
MMLU-ReduxKazakh60.0672.3876.2476.9284.39
English72.9179.4082.6584.5688.11
KazCultureKazakh53.0047.4544.7556.3962.37
KazMMLUKazakh58.1166.1469.2773.0478.98
KazBenchKazakh64.2361.1261.8364.6170.05
BelebeleKazakh81.0782.9181.7084.7688.78
PIQAKazakh63.0070.0081.0078.0085.00
INCLUDEKazakh45.2046.0053.8057.2061.80
Russian59.1756.5258.1564.4970.83
KKCOPAKazakh70.0073.7976.6078.1179.60
NIS MathKazakh66.0087.8894.0093.0098.00
KazQADKazakh70.9967.4042.2865.7670.36
RAGBenchKazakh54.9566.8152.1262.9169.98

Vision Benchmarks

BenchmarkLanguageQolda No-Think (4B)Qolda Think (4B)Qolda-AVL-5BQolda-AVL-9BQolda-AVL-34B
RealWorldQAKazakh53.8648.1052.8150.0755.42
English61.5761.7067.8470.0771.76
Russian56.0857.1259.3560.3966.41
MMStarKazakh53.0859.6067.4568.8972.50
English58.4865.0470.2772.9375.93
Russian55.4859.8466.4769.4573.93
AI2DKazakh63.4866.2672.1873.3479.05
English73.9975.6179.4081.9684.55
MathVistaKazakh58.3266.3370.1772.3474.65
English63.1471.0476.7580.9482.57
MathVisionKazakh35.4144.3852.0755.7562.06
English42.0048.0554.9358.2463.90
MMBenchKazakh79.9783.8587.6989.1990.18
English83.0584.4087.8989.0190.43
OCRBenchKazakh49.8946.4930.6151.2553.97
English69.9068.7073.2077.2079.20

Model Usage

To run inference with Transformers, please follow the guidelines from InternVL.

Alternatively, to run the model via an OpenAI-compatible server, you can use lmdeploy:

pip install lmdeploy>=0.9.1

lmdeploy serve api_server issai/Qolda --server-port 23333 --tp 1 --backend pytorch

Note: Unlike the original InternVL3.5, this model requires the enable_thinking parameter to be explicitly set in the extra_body of your API calls. However, depending on the task complexity, an empty thinking response might be generated.

Then, make a standard API call:

import base64
from openai import OpenAI

client = OpenAI(api_key='YOUR_API_KEY', base_url='http://0.0.0.0:23333/v1')

def encode_image(image_path):
    with open(image_path, "rb") as image_file:
        return base64.b64encode(image_file.read()).decode('utf-8')

image_path = "./assets/eval-results-text.png"

response = client.chat.completions.create(
    model=client.models.list().data[0].id,
    messages=[{
        'role': 'user',
        'content': [
            {
                'type': 'text',
                'text': 'Берілген диаграмманың сипаттамасын бер.'
            },
            {
                'type': 'image_url',
                'image_url': {
                    'url': f'data:image/png;base64,{encode_image(image_path)}',
                },
            }
        ],
    }],
    max_tokens=8192,
    temperature=0.6,
    top_p=0.95,
    extra_body={
        "top_k": 20,
        "enable_thinking": True
    },
)

print(response.choices[0].message.content)

License

This model is licensed under the Apache License 2.0.

Citation

@article{qolda,
  author={Arystanbekov, Batyr and Nurimanov, Aspandiyar and Maxutov, Akylbek and Albrekht, Vladimir and Kuzdeuov, Askat and Varol, Huseyin Atakan},
  journal={IEEE Access}, 
  title={Qolda: A Small Vision–Language Model for the Kazakh Language}, 
  year={2026},
  volume={14},
  number={},
  pages={46392-46414},
  keywords={Computational modeling;Training;Cognition;Adaptation models;Data models;Visualization;Hardware;Benchmark testing;Multilingual;Computer architecture;Large language models;vision-language models;low-resource languages;Kazakh natural language processing;multimodal learning;small vision-language models},
  doi={10.1109/ACCESS.2026.3676919}
}

Кіріспе

InternVL3.5 және Qwen3 негізінде жасалған Qolda — қазақ, орыс және ағылшын тілдерінде жұмыс істеуге арналған шағын көру-тілдік моделі (vision-language model). Модель 4,3 млрд параметрге ие және InternVL3.5-4B моделінің InternViT-300M көру энкодері мен MLP проектор компоненттерін, сондай-ақ Qwen3-4B тілдік моделін қамтиды. Модельді оқыту InternVL фреймворкі көмегімен жүзеге асырылды 💙

"Qolda" атауы модельдің дизайны мен мақсатын қазақ тіліндегі қолда сөзінің қос мағынасы арқылы көрсетеді. Біріншісі, шағын әрі қолжетімді болуы үшін "қолда" cөзі арқылы және екіншісі, көмекші табиғаты үшін, "қолдау" мағынасы арқылы.

Бағалау

Бенчмарк жинақтары мен модель топтамалары мына сілтемелерде қолжетімді:

Төмендегі кестелерде Qolda модельдер тобы бойынша бенчмарк нәтижелері берілген.

Qolda No-Think / Qolda Think · 5B / 9B / 34B = Qolda-AVL нұсқалары

Мәтіндік бенчмарктер

BenchmarkТілQolda No-Think (4B)Qolda Think (4B)Qolda-AVL-5BQolda-AVL-9BQolda-AVL-34B
MMLUҚазақша58.3969.2873.0773.8981.94
Ағылшынша70.0376.4679.0980.9686.71
MMLU-ProҚазақша40.6257.6862.2164.2873.67
Ағылшынша58.0966.3171.2672.6179.00
Орысша47.4262.4566.7968.2976.34
GPQAҚазақша31.8938.6047.9146.9758.77
Ағылшынша39.4645.6252.6853.3663.81
Орысша32.6040.1948.7851.3459.36
ARCҚазақша86.1492.3093.5994.2796.76
Ағылшынша94.2296.1196.9097.2998.17
Орысша91.1794.1796.1196.6297.63
GSM8KҚазақша73.0183.0085.7583.1790.52
Ағылшынша62.8590.2295.2295.8396.44
Орысша84.9983.9890.9092.0494.31
MMLU-ReduxҚазақша60.0672.3876.2476.9284.39
Ағылшынша72.9179.4082.6584.5688.11
KazCultureҚазақша53.0047.4544.7556.3962.37
KazMMLUҚазақша58.1166.1469.2773.0478.98
KazBenchҚазақша64.2361.1261.8364.6170.05
BelebeleҚазақша81.0782.9181.7084.7688.78
PIQAҚазақша63.0070.0081.0078.0085.00
INCLUDEҚазақша45.2046.0053.8057.2061.80
Орысша59.1756.5258.1564.4970.83
KKCOPAҚазақша70.0073.7976.6078.1179.60
NIS MathҚазақша66.0087.8894.0093.0098.00
KazQADҚазақша70.9967.4042.2865.7670.36
RAGBenchҚазақша54.9566.8152.1262.9169.98

Визуалды бенчмарктер

BenchmarkТілQolda No-Think (4B)Qolda Think (4B)Qolda-AVL-5BQolda-AVL-9BQolda-AVL-34B
RealWorldQAҚазақша53.8648.1052.8150.0755.42
Ағылшынша61.5761.7067.8470.0771.76
Орысша56.0857.1259.3560.3966.41
MMStarҚазақша53.0859.6067.4568.8972.50
Ағылшынша58.4865.0470.2772.9375.93
Орысша55.4859.8466.4769.4573.93
AI2DҚазақша63.4866.2672.1873.3479.05
Ағылшынша73.9975.6179.4081.9684.55
MathVistaҚазақша58.3266.3370.1772.3474.65
Ағылшынша63.1471.0476.7580.9482.57
MathVisionҚазақша35.4144.3852.0755.7562.06
Ағылшынша42.0048.0554.9358.2463.90
MMBenchҚазақша79.9783.8587.6989.1990.18
Ағылшынша83.0584.4087.8989.0190.43
OCRBenchҚазақша49.8946.4930.6151.2553.97
Ағылшынша69.9068.7073.2077.2079.20

Модельді қолдану

Transformers арқылы инференсті іске қосу үшін InternVL ұсынған нұсқаулықтарды орындаңыз.

Немесе, модельді OpenAI-үйлесімді сервер арқылы іске қосу үшін lmdeploy құралын пайдалануға болады:

pip install lmdeploy>=0.9.1

lmdeploy serve api_server issai/Qolda --server-port 23333 --tp 1 --backend pytorch

Ескерту: Qolda-ның түпнұсқалық InternVL3.5-тен айырмашылығы, бұл модель API call жасаған кезде extra_body бөлігінде enable_thinking параметрінің нақты орнатылуын талап етеді. Тапсырманың күрделілігіне байланысты бос thinking жауабы қайтарылуы мүмкін.

Содан соң, стандартты API call жасаңыз:

import base64
from openai import OpenAI

client = OpenAI(api_key='YOUR_API_KEY', base_url='http://0.0.0.0:23333/v1')

def encode_image(image_path):
    with open(image_path, "rb") as image_file:
        return base64.b64encode(image_file.read()).decode('utf-8')

image_path = "./assets/eval-results-text.png"

response = client.chat.completions.create(
    model=client.models.list().data[0].id,
    messages=[{
        'role': 'user',
        'content': [
            {
                'type': 'text',
                'text': 'Берілген диаграмманың сипаттамасын бер.'
            },
            {
                'type': 'image_url',
                'image_url': {
                    'url': f'data:image/png;base64,{encode_image(image_path)}',
                },
            }
        ],
    }],
    max_tokens=8192,
    temperature=0.6,
    top_p=0.95,
    extra_body={
        "top_k": 20,
        "enable_thinking": True
    },
)

print(response.choices[0].message.content)

Лицензия

Бұл модель Apache License 2.0 бойынша лицензияланған.

Сілтеме

@article{qolda,
  author={Arystanbekov, Batyr and Nurimanov, Aspandiyar and Maxutov, Akylbek and Albrekht, Vladimir and Kuzdeuov, Askat and Varol, Huseyin Atakan},
  journal={IEEE Access}, 
  title={Qolda: A Small Vision–Language Model for the Kazakh Language}, 
  year={2026},
  volume={14},
  number={},
  pages={46392-46414},
  keywords={Computational modeling;Training;Cognition;Adaptation models;Data models;Visualization;Hardware;Benchmark testing;Multilingual;Computer architecture;Large language models;vision-language models;low-resource languages;Kazakh natural language processing;multimodal learning;small vision-language models},
  doi={10.1109/ACCESS.2026.3676919}
}

conversational
custom_code
image-text-to-text
internvl_chat
safetensors