Phi-3.5-mini-instruct OpenVINO (INT8)

OpenVINO IR conversion of microsoft/Phi-3.5-mini-instruct with weight-only INT8 quantization, produced on CPU-only Kaggle with optimum-cli (fully offline, token-free).

  • Base model: microsoft/Phi-3.5-mini-instruct (Phi3ForCausalLM, 3.8B params, MIT)
  • Task: text-generation
  • Precision: weights INT8 (NNCF), activations FP16/FP32 as traced
  • Converted with: optimum-intel 2.2.0, openvino 2026.4.1, transformers 5.16.1
  • Context: 128k tokens (longrope scaling)

Usage

optimum-intel

from optimum.intel import OVModelForCausalLM
from transformers import AutoTokenizer

model = OVModelForCausalLM.from_pretrained("Nekodeus/phi35-mini-instruct-openvino")
tok = AutoTokenizer.from_pretrained("Nekodeus/phi35-mini-instruct-openvino")
inputs = tok("<|user|>\nExplain recursion in programming.<|end|>\n<|assistant|>\n", return_tensors="pt")
print(tok.decode(model.generate(**inputs, max_new_tokens=256)[0]))

OpenVINO GenAI

ov::genai::LLMPipeline pipe("path/to/Nekodeus/phi35-mini-instruct-openvino", "CPU");

Reproduce

optimum-cli export openvino \
  --model microsoft/Phi-3.5-mini-instruct \
  --task text-generation \
  --weight-format int8 \
  phi35-mini-instruct-openvino
Downloads last month
26
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support