NVIDIA heeft in augustus 2026 Nemotron 3.5 Lightning uitgebracht, een open mixture-of-experts-model van 30 miljard parameters waarvan er slechts 3 miljard per token actief zijn. Het model is specifiek gebouwd voor always-on agentgebruik en werd vrijwel meteen toegevoegd aan de modelbibliotheek van Ollama, zodat het met een enkel commando lokaal te draaien is.
Een model gemaakt voor agents, niet voor chatten
Wat Nemotron 3.5 Lightning onderscheidt van veel andere lokale modellen is de contextlengte van 1 miljoen tokens, gecombineerd met de lage actieve parametercount. Die combinatie is precies wat je nodig hebt voor agentworkloads: lange lopende sessies waarin een model voortdurend tussen tools, bestanden en tussenresultaten schakelt, terwijl het toch snel genoeg blijft reageren om bruikbaar te zijn. NVIDIA publiceerde tegelijk een vLLM-recept dat specifiek is afgestemd op een enkel DGX Spark-systeem, wat aangeeft dat het model bewust is ontworpen om op consumentenvriendelijke lokale hardware te draaien in plaats van uitsluitend in datacenters.
De release viel in dezelfde week als andere agent-gerichte toevoegingen aan Ollama, waaronder ondersteuning voor DeepSeek Harness en Meta’s Muse Code-agent, plus uitgebreide websearch-mogelijkheden in de OpenAI-compatibele API van Ollama zelf. Samen schetsen deze updates een duidelijk beeld: de lokale-LLM-tooling verschuift van chatten met een model op je laptop naar het draaien van een volwaardige AI-agent die tools aanroept, bestanden aanpast en meerdere stappen zelfstandig uitvoert, zonder dat er data naar een externe server hoeft.
Waarom dit voor Dev Tools-gebruikers belangrijk is
Voor ontwikkelaars die experimenteren met agentic coding-assistenten is de combinatie van lage latency, een groot contextvenster en lokale uitvoering een serieus alternatief voor clouddiensten. Een MoE-model met maar 3 miljard actieve parameters is haalbaar op hardware die een paar jaar geleden nog ondenkbaar was voor een miljoen-token contextvenster, en de energie- en kostenvoetafdruk is navenant lager dan bij dichte modellen van vergelijkbare kwaliteit.
Er zit ook een strategische kant aan: doordat NVIDIA zelf het vLLM-recept publiceert en Ollama het model direct opneemt, wordt de drempel om te experimenteren minimaal. Je hoeft niet zelf uit te zoeken welke quantisatie, welke context-instellingen en welke serveropties optimaal zijn; dat werk is al gedaan en gedocumenteerd.
Voor teams die overwegen zelf agentinfrastructuur lokaal te hosten, is dit een goed moment om Nemotron 3.5 Lightning naast bestaande favorieten zoals Qwen en Llama te leggen en te kijken welk model het beste presteert op de eigen taken en hardware.
Bron: https://releasebot.io/updates/ollama
0 reacties