πŸ“° ChatGPT vervangt modelnamen door een simpele schuifregelaarπŸ“° Rechtszaak tegen Anthropic: leverde Claude Max wel de beloofde capaciteit?πŸ“° MCP wordt stateless: het protocol achter agentic AI krijgt een grote architectuurmakeoverπŸ“° Fable 5: Anthropics nieuwe vlaggenschipmodel verslaat Opus 4.8πŸ“° Claude Sonnet 5 wordt het nieuwe standaardmodel voor gratis gebruikersπŸ“° GPT-5.6 in preview: OpenAI splitst modellen in Sol, Terra en LunaπŸ“° Claude Sonnet 5 wordt de nieuwe standaard, en Claude Desktop landt eindelijk op LinuxπŸ“° Claude Code-automatisering krijgt eigen dollarfacturering los van je abonnementπŸ“° ChatGPT vervangt modelnamen door een simpele schuifregelaarπŸ“° Rechtszaak tegen Anthropic: leverde Claude Max wel de beloofde capaciteit?πŸ“° MCP wordt stateless: het protocol achter agentic AI krijgt een grote architectuurmakeoverπŸ“° Fable 5: Anthropics nieuwe vlaggenschipmodel verslaat Opus 4.8πŸ“° Claude Sonnet 5 wordt het nieuwe standaardmodel voor gratis gebruikersπŸ“° GPT-5.6 in preview: OpenAI splitst modellen in Sol, Terra en LunaπŸ“° Claude Sonnet 5 wordt de nieuwe standaard, en Claude Desktop landt eindelijk op LinuxπŸ“° Claude Code-automatisering krijgt eigen dollarfacturering los van je abonnement

Met de komst van de Apple M5 Max-chip is het draaien van grote taalmodellen op een laptop dit jaar opnieuw een stuk praktischer geworden. Benchmarks die deze zomer verschenen laten zien dat een MacBook met M5 Max en 128GB unified memory 70B-modellen op Q8-quantisatie haalt met ongeveer 16 tokens per seconde, en MoE-modellen in de 120B-klasse op Q4 met vergelijkbare snelheid draait. Voor developers die serieus met lokale modellen werken, verschuift dat de grens van wat praktisch bruikbaar is aanzienlijk.

Waarom unified memory het verschil maakt

Het fundamentele voordeel van Apple Silicon voor lokale inferentie zit niet alleen in ruwe rekenkracht, maar in de architectuur: CPU, GPU-neurale versnellers en de Neural Engine delen een fysieke geheugenpool, met zero-copy datatoegang via IOSurface. Een tensor die voor GPU-inferentie is geladen, is direct beschikbaar voor de Neural Engine of de CPU zonder expliciete geheugenkopieen. Dat elimineert de host-naar-device-overhead die bij NVIDIA CUDA-opstellingen een blijvend knelpunt is, waar VRAM en systeemgeheugen strikt gescheiden blijven.

De M5 Max levert daarbij ongeveer 28 procent meer tokens per seconde dan zijn voorganger, de M4 Max, dankzij hogere geheugenbandbreedte (614 GB/s), meer GPU-rekenkracht en een verbeterde Neural Engine. Voor de kleinere M5 Pro-variant met 64GB geheugen betekent dit dat 8B-modellen 45 tot 55 tokens per seconde halen en 34B-modellen 15 tot 20 tokens per seconde, ruim voldoende voor interactief gebruik.

MLX versus llama.cpp

Een tweede, minstens zo belangrijke ontwikkeling is dat Apple’s eigen MLX-framework op M5-hardware inmiddels 30 tot 40 procent sneller is dan llama.cpp. Dat is een significante omslag: waar llama.cpp lange tijd de facto standaard was voor lokale inferentie op vrijwel elk platform, is er op Apple Silicon nu een concreet prestatievoordeel te behalen door specifiek voor MLX te optimaliseren. Tools als LM Studio hebben hun MLX-engine dit jaar dan ook actief bijgewerkt om van dat voordeel te profiteren.

Wat dit betekent voor Nederlandse developers

Voor wie overweegt te investeren in hardware voor lokale AI-ontwikkeling, verschuift dit de vergelijking tussen een Mac met veel unified memory en een discrete GPU-opstelling of iets als de NVIDIA DGX Spark. De Mac-route heeft als voordeel een laag stroomverbruik (25 tot 70 watt), stille werking en geen harde VRAM-limiet, wat met name voor het lokaal draaien van grote MoE-modellen aantrekkelijk is. Het blijft wel zaak om per gebruiksscenario te testen: voor pure doorvoersnelheid bij lange, drukke agentworkloads kan gespecialiseerde GPU-hardware nog steeds de betere keuze zijn, maar voor de gemiddelde developer die ’s avonds thuis experimenteert met een 30B- tot 70B-model, is een goed geconfigureerde M5 Max-Mac inmiddels een serieus alternatief voor een dure cloud-opstelling.

Bron: https://llmcheck.net/blog/apple-silicon-m5-max-local-ai-guide/

CategorieΓ«n: NIEUWS

0 reacties

Geef een reactie

Avatar plaatshouder

Je e-mailadres wordt niet gepubliceerd. Vereiste velden zijn gemarkeerd met *