Tommrbn/AI-localhost

0

stars

1

commits

CSS

primary language

Apr 14, 2026

updated

README

AI localhost

Elegi Qwen2.5-0.5B quantizada por la capacidad de mi cpu, pero lo puedes cambiar al que pueda tu maquina. Tambien por lo que podran ver es porque era mas rapido que sin quantizar

fp16q4_k_m
Carga1.70s1.69s
Inferencia0.60s0.43s
Tokens/seg(eval)29.7846.73

Llama-cpp.python es una motor de inferencia escrito en C/C++ que sabe como leer esos pesos, cargarlos en memoria y ejecutar la red neuronal para generar texto en este caso y sirve para correr CPU sin necesidad de GPU.

Usamos FastAPI para crear una API y asi poder conectarlo con el modelo y interactuar con el desde la pagina.

Antes de comenzar, Primero necesitas instalar python.

python -m ensurepip --upgrade

En caso que lo tengas, verificalo con este comando

py --version

Vamos a crear un entorno virtual para no tener conflictos con tus otros proyectos o librerias que sean globales. Para eso vamos a crear un entorno:

py -m venv venv
venv\Scripts\activate

Para correr el servidor nos faltaria instalar FastAPI.

pip install "fastapi[standard]"

Para correrlo primero se necesita instala llama-cpp.python

pip install llama-cpp-python

Luego de instalarlo, se necesita instalar un LLM, que lo saque de hugging face

https://huggingface.co/models

En este caso yo elegi este modelo, pero quantizado

https://huggingface.co/Qwen/Qwen2.5-0.5B-Instruct-GGUF

Una vez instalado estas dos cosas, puedes reemplazar el modelo que instalaste y modificarlo en el archivo model.py.

Por ultimo, para poder levantar el server, tienes que poner este comando

uvicorn main:app

Tiene un limite de texto hacia el LLM, tira error en caso que no haya ningun rol agregado o tampoco haya contenido.

Cada request se va a guardar en un archivo .log, para que vea el historial de la conversacion en caso que haya algun error.

Contributors

Tommrbn

1 commits

Tommrbn/AI-localhost

0

stars

1

commits

CSS

primary language

Apr 14, 2026

updated

README

AI localhost

Elegi Qwen2.5-0.5B quantizada por la capacidad de mi cpu, pero lo puedes cambiar al que pueda tu maquina. Tambien por lo que podran ver es porque era mas rapido que sin quantizar

fp16q4_k_m
Carga1.70s1.69s
Inferencia0.60s0.43s
Tokens/seg(eval)29.7846.73

Llama-cpp.python es una motor de inferencia escrito en C/C++ que sabe como leer esos pesos, cargarlos en memoria y ejecutar la red neuronal para generar texto en este caso y sirve para correr CPU sin necesidad de GPU.

Usamos FastAPI para crear una API y asi poder conectarlo con el modelo y interactuar con el desde la pagina.

Antes de comenzar, Primero necesitas instalar python.

python -m ensurepip --upgrade

En caso que lo tengas, verificalo con este comando

py --version

Vamos a crear un entorno virtual para no tener conflictos con tus otros proyectos o librerias que sean globales. Para eso vamos a crear un entorno:

py -m venv venv
venv\Scripts\activate

Para correr el servidor nos faltaria instalar FastAPI.

pip install "fastapi[standard]"

Para correrlo primero se necesita instala llama-cpp.python

pip install llama-cpp-python

Luego de instalarlo, se necesita instalar un LLM, que lo saque de hugging face

https://huggingface.co/models

En este caso yo elegi este modelo, pero quantizado

https://huggingface.co/Qwen/Qwen2.5-0.5B-Instruct-GGUF

Una vez instalado estas dos cosas, puedes reemplazar el modelo que instalaste y modificarlo en el archivo model.py.

Por ultimo, para poder levantar el server, tienes que poner este comando

uvicorn main:app

Tiene un limite de texto hacia el LLM, tira error en caso que no haya ningun rol agregado o tampoco haya contenido.

Cada request se va a guardar en un archivo .log, para que vea el historial de la conversacion en caso que haya algun error.

Contributors

Tommrbn

1 commits

Languages

CSS

34.1%

Python

33.0%

JavaScript

20.6%

HTML

12.3%