πŸ“° ChatGPT vervangt modelnamen door een simpele schuifregelaarπŸ“° Rechtszaak tegen Anthropic: leverde Claude Max wel de beloofde capaciteit?πŸ“° MCP wordt stateless: het protocol achter agentic AI krijgt een grote architectuurmakeoverπŸ“° Fable 5: Anthropics nieuwe vlaggenschipmodel verslaat Opus 4.8πŸ“° Claude Sonnet 5 wordt het nieuwe standaardmodel voor gratis gebruikersπŸ“° GPT-5.6 in preview: OpenAI splitst modellen in Sol, Terra en LunaπŸ“° Claude Sonnet 5 wordt de nieuwe standaard, en Claude Desktop landt eindelijk op LinuxπŸ“° Claude Code-automatisering krijgt eigen dollarfacturering los van je abonnementπŸ“° ChatGPT vervangt modelnamen door een simpele schuifregelaarπŸ“° Rechtszaak tegen Anthropic: leverde Claude Max wel de beloofde capaciteit?πŸ“° MCP wordt stateless: het protocol achter agentic AI krijgt een grote architectuurmakeoverπŸ“° Fable 5: Anthropics nieuwe vlaggenschipmodel verslaat Opus 4.8πŸ“° Claude Sonnet 5 wordt het nieuwe standaardmodel voor gratis gebruikersπŸ“° GPT-5.6 in preview: OpenAI splitst modellen in Sol, Terra en LunaπŸ“° Claude Sonnet 5 wordt de nieuwe standaard, en Claude Desktop landt eindelijk op LinuxπŸ“° Claude Code-automatisering krijgt eigen dollarfacturering los van je abonnement

Het vLLM-team publiceerde begin juni 2026 een uitgebreide technische blogpost over het draaien van vLLM op de NVIDIA DGX Spark, het compacte desktopsysteem rond de Grace Blackwell GB10-superchip. Met 128GB unified memory en ongeveer een petaflop aan AI-rekenkracht in een behuizing van 1,2 kilo, positioneert NVIDIA de Spark expliciet als een datacenter op je bureau voor ontwikkelaars die lokaal met grote modellen willen werken.

Wat de DGX Spark anders maakt

Voor 4.679 dollar krijg je een systeem dat modellen tot 200 miljard parameters lokaal kan draaien op 35 tot 80-plus tokens per seconde, en dat modellen tot 70 miljard parameters kan fine-tunen zonder cloud-GPU’s te huren. Dat is een andere hardwareklasse dan een consumenten-Mac of een enkele RTX-videokaart: de DGX Spark combineert de architectuur van NVIDIA’s datacenter-Grace Blackwell-lijn met een vorm factor die op een bureau past, inclusief unified memory die CPU en GPU delen, vergelijkbaar in filosofie met wat Apple met zijn Silicon-chips doet, maar dan met CUDA-compatibiliteit.

Voor wie meer geheugen nodig heeft dan een systeem biedt, kunnen twee DGX Spark-eenheden aan elkaar worden gekoppeld via ConnectX-7-netwerken met 200 Gbps bandbreedte, wat een gecombineerde 256GB oplevert voor nog grotere modellen of langere contextvensters.

vLLM als productieklare serveerlaag

De blogpost van het vLLM-team ging specifiek in op configuratie en architectuurkeuzes om lokale modellen via vLLM optimaal te serveren op deze hardware, inclusief tensor-parallelle instellingen en geheugenbeheer die zijn afgestemd op de eigenschappen van de GB10-chip. Dat is relevant omdat vLLM zich in 2026 steeds nadrukkelijker heeft ontwikkeld tot de standaardkeuze voor wie een model niet alleen wil draaien, maar ook echt wil serveren: met ondersteuning voor speculative decoding, een async scheduler die de time-to-first-token verlaagt, en sinds kort ook Windows-ondersteuning voor recente RTX-kaarten.

NVIDIA volgde deze release met eigen software-optimalisaties specifiek voor DGX Spark, en publiceerde later die zomer ook een vLLM-recept voor het nieuwe Nemotron 3.5 Lightning-model, dat is toegesneden op precies dit type systeem.

Relevantie voor Dev Tools-gebruikers

Voor Nederlandse teams die overwegen te investeren in dedicated lokale AI-hardware, laat deze combinatie van DGX Spark en vLLM zien dat er inmiddels een volwassen, goed gedocumenteerd pad bestaat tussen een model op je laptop draaien en een volledige on-premise inferentieserver bouwen. Het prijskaartje is niet triviaal, maar voor organisaties die grote of gevoelige workloads structureel lokaal willen draaien, is dit een van de weinige opties die zowel de rekenkracht als de geheugencapaciteit biedt om modellen van meer dan 100 miljard parameters daadwerkelijk bruikbaar te serveren zonder een clouddienst.

Bron: https://vllm.ai/blog/2026-06-01-vllm-dgx-spark

CategorieΓ«n: NIEUWS

0 reacties

Geef een reactie

Avatar plaatshouder

Je e-mailadres wordt niet gepubliceerd. Vereiste velden zijn gemarkeerd met *