πŸ“° ChatGPT vervangt modelnamen door een simpele schuifregelaarπŸ“° Rechtszaak tegen Anthropic: leverde Claude Max wel de beloofde capaciteit?πŸ“° MCP wordt stateless: het protocol achter agentic AI krijgt een grote architectuurmakeoverπŸ“° Fable 5: Anthropics nieuwe vlaggenschipmodel verslaat Opus 4.8πŸ“° Claude Sonnet 5 wordt het nieuwe standaardmodel voor gratis gebruikersπŸ“° GPT-5.6 in preview: OpenAI splitst modellen in Sol, Terra en LunaπŸ“° Claude Sonnet 5 wordt de nieuwe standaard, en Claude Desktop landt eindelijk op LinuxπŸ“° Claude Code-automatisering krijgt eigen dollarfacturering los van je abonnementπŸ“° ChatGPT vervangt modelnamen door een simpele schuifregelaarπŸ“° Rechtszaak tegen Anthropic: leverde Claude Max wel de beloofde capaciteit?πŸ“° MCP wordt stateless: het protocol achter agentic AI krijgt een grote architectuurmakeoverπŸ“° Fable 5: Anthropics nieuwe vlaggenschipmodel verslaat Opus 4.8πŸ“° Claude Sonnet 5 wordt het nieuwe standaardmodel voor gratis gebruikersπŸ“° GPT-5.6 in preview: OpenAI splitst modellen in Sol, Terra en LunaπŸ“° Claude Sonnet 5 wordt de nieuwe standaard, en Claude Desktop landt eindelijk op LinuxπŸ“° Claude Code-automatisering krijgt eigen dollarfacturering los van je abonnement

Ollama, de runtime die stilletjes de standaardmanier is geworden waarop ontwikkelaars open-weight modellen op hun eigen machine draaien, heeft een update uitgebracht die het rechtstreeks koppelt aan Claude Desktop β€” waardoor je lokale modellen kunt aan- en uitzetten vanuit dezelfde menubalk als waarmee je een gehoste assistent beheert. Op papier een kleine feature, maar het wijst op iets groters: de grens tussen “cloud AI-assistent” en “lokale model-runtime” wordt bewust vager gemaakt.

Wat de integratie precies doet

De nieuwe release voegt een aparte Apps-weergave toe waarin door Ollama beheerde lokale modellen naast je andere integraties verschijnen, en waarmee je kunt wisselen welk model een gesprek aandrijft zonder de interface te verlaten waarin je al zit. In de praktijk betekent dit dat je een gesprek kunt starten met een gehost model, en dan kunt overschakelen naar een lokale Llama- of Qwen-checkpoint voor alles wat je liever niet van je machine laat vertrekken β€” een contract dat je doorneemt, een codebase onder NDA, debuggen dicht bij credentials β€” zonder van app te wisselen of je plek kwijt te raken.

Dit komt samen met verbeteringen aan caching, een fix voor problemen met het herstellen van prefill (waardoor het hervatten van een lange lokale context traag aanvoelde), en β€” opvallend β€” ondersteuning voor Linux en Windows voor MLX, het ML-framework van Apple dat qua inference historisch beperkt was tot macOS/Apple Silicon. Dat Ollama modeldownload-checks nu lokaal laat verlopen, is een kleiner maar relevant detail als je ooit een model-pull hebt zien vasthangen door een wisselende verbinding met Ollama’s registry.

Waarom local-first momentum wint bij ontwikkelaars specifiek

Het cijfer om even bij stil te staan: alleen al Llama 3.1 is via Ollama meer dan 112 miljoen keer gedownload, en het project heeft in augustus 2026 in totaal 88 miljoen dollar aan funding opgehaald. Dat is geen hobbyprojectje meer β€” het is infrastructuur die een aanzienlijk deel van de ontwikkelaarspopulatie al in hun workflow heeft verweven, meestal om een van drie redenen: kosten (geen per-token facturering bij veel lokaal testen), latency (geen netwerk-round trip) en dataresidentie (er verlaat niets de machine).

De integratie met Claude Desktop is specifiek gericht op een workflow die veel ontwikkelaars al informeel hebben: een sterk gehost model gebruiken voor het zware redeneerwerk, en een snel lokaal model voor repetitieve taken met lage inzet β€” lint-suggesties, boilerplate genereren, snelle lookups β€” waarbij per-call betalen voor een gehost model geen zin heeft. Beide beschikbaar hebben in dezelfde UI, per gesprek te wisselen, haalt de frictie weg die deze workflow voorheen beperkte tot mensen die bereid waren twee losse apps naast elkaar te draaien.

Wat je zelf kunt proberen

Draai je al op Ollama v0.32.x, dan zou de update gewoon als standaard puntrelease moeten verschijnen β€” het project brengt om de paar dagen nieuwe builds uit, dus check je versie met ollama --version en update als je meer dan een paar releases achterloopt. Heb je lokale modellen nog nooit voor iets serieus geprobeerd, dan is deze integratie een prima aanleiding om een klein gequantiseerd model te pullen (een Llama- of Qwen-variant in de 8B-klasse is een verstandig startpunt op de meeste laptops) en te kijken waar het al goed genoeg is om een gehoste API-call te besparen.

De trend om in de gaten te houden is of andere aanbieders van AI-assistenten volgen met hun eigen lokale-runtime-integraties β€” zodra één grote desktopclient een lokaal model behandelt als een volwaardig, wisselbaar backend in plaats van een aparte categorie tool, wordt het lastiger voor concurrenten om lokale inference als niche te blijven behandelen.

Bron: What is Ollama: Run AI Models Locally in August 2026

CategorieΓ«n: 1

0 reacties

Geef een reactie

Avatar plaatshouder

Je e-mailadres wordt niet gepubliceerd. Vereiste velden zijn gemarkeerd met *