Elegi Qwen2.5-0.5B quantizada por la capacidad de mi cpu, pero lo puedes cambiar al que pueda tu maquina. Tambien por lo que podran ver es porque era mas rapido que sin quantizar
| fp16 | q4_k_m | |
|---|---|---|
| Carga | 1.70s | 1.69s |
| Inferencia | 0.60s | 0.43s |
| Tokens/seg(eval) | 29.78 | 46.73 |
Llama-cpp.python es una motor de inferencia escrito en C/C++ que sabe como leer esos pesos, cargarlos en memoria y ejecutar la red neuronal para generar texto en este caso y sirve para correr CPU sin necesidad de GPU.
Usamos FastAPI para crear una API y asi poder conectarlo con el modelo y interactuar con el desde la pagina.
Antes de comenzar, Primero necesitas instalar python.
python -m ensurepip --upgrade
En caso que lo tengas, verificalo con este comando
py --version
Vamos a crear un entorno virtual para no tener conflictos con tus otros proyectos o librerias que sean globales. Para eso vamos a crear un entorno:
py -m venv venv
venv\Scripts\activate
Para correr el servidor nos faltaria instalar FastAPI.
pip install "fastapi[standard]"
Para correrlo primero se necesita instala llama-cpp.python
pip install llama-cpp-python
Luego de instalarlo, se necesita instalar un LLM, que lo saque de hugging face
En este caso yo elegi este modelo, pero quantizado
https://huggingface.co/Qwen/Qwen2.5-0.5B-Instruct-GGUF
Una vez instalado estas dos cosas, puedes reemplazar el modelo que instalaste y modificarlo en el archivo model.py.
Por ultimo, para poder levantar el server, tienes que poner este comando
uvicorn main:app
Tiene un limite de texto hacia el LLM, tira error en caso que no haya ningun rol agregado o tampoco haya contenido.
Cada request se va a guardar en un archivo .log, para que vea el historial de la conversacion en caso que haya algun error.
1 commits
CSS
34.1%
Python
33.0%
JavaScript
20.6%
HTML
12.3%
Elegi Qwen2.5-0.5B quantizada por la capacidad de mi cpu, pero lo puedes cambiar al que pueda tu maquina. Tambien por lo que podran ver es porque era mas rapido que sin quantizar
| fp16 | q4_k_m | |
|---|---|---|
| Carga | 1.70s | 1.69s |
| Inferencia | 0.60s | 0.43s |
| Tokens/seg(eval) | 29.78 | 46.73 |
Llama-cpp.python es una motor de inferencia escrito en C/C++ que sabe como leer esos pesos, cargarlos en memoria y ejecutar la red neuronal para generar texto en este caso y sirve para correr CPU sin necesidad de GPU.
Usamos FastAPI para crear una API y asi poder conectarlo con el modelo y interactuar con el desde la pagina.
Antes de comenzar, Primero necesitas instalar python.
python -m ensurepip --upgrade
En caso que lo tengas, verificalo con este comando
py --version
Vamos a crear un entorno virtual para no tener conflictos con tus otros proyectos o librerias que sean globales. Para eso vamos a crear un entorno:
py -m venv venv
venv\Scripts\activate
Para correr el servidor nos faltaria instalar FastAPI.
pip install "fastapi[standard]"
Para correrlo primero se necesita instala llama-cpp.python
pip install llama-cpp-python
Luego de instalarlo, se necesita instalar un LLM, que lo saque de hugging face
En este caso yo elegi este modelo, pero quantizado
https://huggingface.co/Qwen/Qwen2.5-0.5B-Instruct-GGUF
Una vez instalado estas dos cosas, puedes reemplazar el modelo que instalaste y modificarlo en el archivo model.py.
Por ultimo, para poder levantar el server, tienes que poner este comando
uvicorn main:app
Tiene un limite de texto hacia el LLM, tira error en caso que no haya ningun rol agregado o tampoco haya contenido.
Cada request se va a guardar en un archivo .log, para que vea el historial de la conversacion en caso que haya algun error.
1 commits
CSS
34.1%
Python
33.0%
JavaScript
20.6%
HTML
12.3%