nemotron-mini

A commercial-friendly small language model by NVIDIA optimized for roleplay, RAG QA, and function calling.

Araç Kullanımı 4b
Hızlı Kurulum (Ollama kuruluysa)
ollama run nemotron-mini

Ollama kurulu değil mi? ollama.com/download — Windows, macOS ve Linux için ücretsiz. İlk çalıştırmada model indirilir, sonrası tamamen çevrimdışıdır.

Varyantlar

Boyut büyüdükçe kalite artar, donanım ihtiyacı yükselir. Başlangıç için küçük varyantı deneyin.

EtiketBoyutBağlamGirdiKomut
latest 2.7GB 4K Text ollama run nemotron-mini:latest
4b 2.7GB 4K Text ollama run nemotron-mini:4b
4b-instruct-q2_K 1.9GB 4K Text ollama run nemotron-mini:4b-instruct-q2_K
4b-instruct-q3_K_S 2.1GB 4K Text ollama run nemotron-mini:4b-instruct-q3_K_S
4b-instruct-q3_K_M 2.3GB 4K Text ollama run nemotron-mini:4b-instruct-q3_K_M
4b-instruct-q3_K_L 2.5GB 4K Text ollama run nemotron-mini:4b-instruct-q3_K_L
4b-instruct-q4_0 2.6GB 4K Text ollama run nemotron-mini:4b-instruct-q4_0
4b-instruct-q4_1 2.8GB 4K Text ollama run nemotron-mini:4b-instruct-q4_1
4b-instruct-q4_K_S 2.6GB 4K Text ollama run nemotron-mini:4b-instruct-q4_K_S
4b-instruct-q4_K_M 2.7GB 4K Text ollama run nemotron-mini:4b-instruct-q4_K_M
4b-instruct-q5_0 3.0GB 4K Text ollama run nemotron-mini:4b-instruct-q5_0
4b-instruct-q5_1 3.2GB 4K Text ollama run nemotron-mini:4b-instruct-q5_1
4b-instruct-q5_K_S 3.0GB 4K Text ollama run nemotron-mini:4b-instruct-q5_K_S
4b-instruct-q5_K_M 3.1GB 4K Text ollama run nemotron-mini:4b-instruct-q5_K_M
4b-instruct-q6_K 3.4GB 4K Text ollama run nemotron-mini:4b-instruct-q6_K
4b-instruct-q8_0 4.5GB 4K Text ollama run nemotron-mini:4b-instruct-q8_0
4b-instruct-fp16 8.4GB 4K Text ollama run nemotron-mini:4b-instruct-fp16

Model Detayları ve Benchmarklar (kaynak: ollama.com)

Nemotron-Mini-4B-Instruct is a model for generating responses for roleplaying, retrieval augmented generation, and function calling. It is a small language model (SLM) optimized through distillation, pruning and quantization for speed and on-device deployment.

This instruct model is optimized for roleplay, RAG QA, and function calling in English. It supports a context length of 4,096 tokens. This model is ready for commercial use.

References

Blog

HuggingFace