[{"data":1,"prerenderedAt":1741},["ShallowReactive",2],{"blog-post-nl-\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700":3,"blog-posts-sidebar-nl":1263},{"id":4,"title":5,"body":6,"categories":1246,"date":1251,"description":1252,"extension":1253,"heading":1254,"image":1255,"meta":1256,"navigation":695,"originalUrl":1257,"path":1258,"seo":1259,"slug":1260,"stem":1261,"updated":1254,"__hash__":1262},"blogNl\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700.md","Qwen3.8 GGUF in vLLM: sneller antwoord op één Radeon",{"type":7,"value":8,"toc":1233},"minimark",[9,28,42,61,64,69,78,81,86,102,113,116,137,142,146,157,166,169,176,187,191,206,212,223,304,313,316,325,328,333,342,351,355,366,387,393,404,457,466,470,481,506,509,513,528,598,605,614,618,624,635,650,720,733,736,839,848,852,855,864,869,882,885,1229],[10,11,12,16],"p",{},[13,14,15],"strong",{},"De originele NEO CODER MAX-gewichten. Uitvoering gecompileerd met Paiton. Tot 6,4% lagere responstijd voor opgewarmde verzoeken dan onze vergelijkbare llama.cpp-referentie op een Radeon AI PRO R9700.",[17,18,19],"sup",{},[20,21,27],"a",{"href":22,"ariaDescribedBy":23,"dataFootnoteRef":25,"id":26},"#user-content-fn-readme",[24],"footnote-label","","user-content-fnref-readme","1",[10,29,30,34],{},[31,32,33],"em",{},"De originele GGUF-gewichten, daadwerkelijk geserveerd door vLLM. Uitvoering gecompileerd met Paiton op één Radeon AI PRO R9700.",[17,35,36],{},[20,37,41],{"href":38,"ariaDescribedBy":39,"dataFootnoteRef":25,"id":40},"#user-content-fn-native",[24],"user-content-fnref-native","2",[10,43,44,45,53],{},"Qwen3.8 NEO CODER MAX van DavidAU krijgt veel aandacht. Op 14 september 2026 vermeldde de Hugging Face-repository 875.703 downloads in de voorgaande maand. Dat is het aantal downloads van de repository, niet het aantal unieke gebruikers. Het geeft wel een indruk van de belangstelling voor deze fine-tune.",[17,46,47],{},[20,48,52],{"href":49,"ariaDescribedBy":50,"dataFootnoteRef":25,"id":51},"#user-content-fn-model",[24],"user-content-fnref-model","3",[17,54,55],{},[20,56,60],{"href":57,"ariaDescribedBy":58,"dataFootnoteRef":25,"id":59},"#user-content-fn-downloads",[24],"user-content-fnref-downloads","4",[10,62,63],{},"Wij wilden een andere vraag beantwoorden dan je in een doorsnee modelreview tegenkomt:",[10,65,66],{},[13,67,68],{},"Kun je de originele GGUF-fine-tune behouden, via vLLM aanbieden en toch concurreren met llama.cpp op één Radeon?",[10,70,71,72],{},"Voor het geteste model en deze configuratie is het antwoord ja. Paiton voert het geselecteerde Q4_K_M-checkpoint met native AMD-code binnen vLLM uit. Verzoeken worden dus niet doorgestuurd naar een aparte llama.cpp-server.",[17,73,74],{},[20,75,41],{"href":38,"ariaDescribedBy":76,"dataFootnoteRef":25,"id":77},[24],"user-content-fnref-native-2",[10,79,80],{},"De fine-tune is van de maker. De uitvoering is van ons.",[82,83,85],"h2",{"id":84},"gguf-ondersteunen-is-niet-hetzelfde-als-gguf-optimaal-uitvoeren","GGUF ondersteunen is niet hetzelfde als GGUF optimaal uitvoeren",[10,87,88,89,93,94],{},"vLLM ondersteunt GGUF al. Toch omschrijft de huidige documentatie die ondersteuning als zeer experimenteel en nog onvoldoende geoptimaliseerd, met mogelijke incompatibiliteiten met andere functies. De ondersteuning is inmiddels ondergebracht in de upstream ",[90,91,92],"code",{},"vllm-gguf-plugin",".",[17,95,96],{},[20,97,101],{"href":98,"ariaDescribedBy":99,"dataFootnoteRef":25,"id":100},"#user-content-fn-vllm",[24],"user-content-fnref-vllm","5",[10,103,104,105],{},"Die plugin documenteert al verschillende modelfamilies, waaronder verwante Qwen-modellen voor tekst en beeld. We kondigen dus niet aan dat GGUF voor het eerst mogelijk is in vLLM.",[17,106,107],{},[20,108,112],{"href":109,"ariaDescribedBy":110,"dataFootnoteRef":25,"id":111},"#user-content-fn-upstream",[24],"user-content-fnref-upstream","6",[10,114,115],{},"Onze doelstelling is specifieker: deze GGUF-fine-tune efficiënt op AMD-hardware laten draaien, zonder gebruikers naar een ander checkpoint of een ander serving-framework te laten overstappen.",[10,117,118,119,127,128,136],{},"GGUF is een container voor gewichten en metadata, geen verplichting om één bepaalde inference-engine te gebruiken.",[17,120,121],{},[20,122,126],{"href":123,"ariaDescribedBy":124,"dataFootnoteRef":25,"id":125},"#user-content-fn-gguf",[24],"user-content-fnref-gguf","7"," En llama.cpp heeft zelf al een OpenAI-compatibele server.",[17,129,130],{},[20,131,135],{"href":132,"ariaDescribedBy":133,"dataFootnoteRef":25,"id":134},"#user-content-fn-llama",[24],"user-content-fnref-llama","8"," Alleen een API-wrapper toevoegen zou hier niet de prestatie zijn.",[10,138,139],{},[13,140,141],{},"Het verschil zit in echte vLLM-serving, met de gecompileerde native uitvoering van Paiton eronder.",[82,143,145],{"id":144},"behoud-de-fine-tune-verander-de-uitvoering","Behoud de fine-tune. Verander de uitvoering.",[10,147,148,149],{},"Het geselecteerde checkpoint is de originele GGUF van de maker met gemengde Q4_K_M-kwantisatie, inclusief de tensors met hogere precisie en de BF16-outputlaag. We hebben het niet vervangen door het basismodel van Qwen of omgezet naar een nieuw AWQ-checkpoint.",[17,150,151],{},[20,152,156],{"href":153,"ariaDescribedBy":154,"dataFootnoteRef":25,"id":155},"#user-content-fn-lock",[24],"user-content-fnref-lock","9",[10,158,159,160],{},"Paiton verzorgt de native uitvoering voor taal en beeld. vLLM behoudt de integratie voor het laden van het model, de planning van verzoeken, sampling en de streaminginterface. De compiler blijft gesloten; de publieke release bevat de runtimebestanden die nodig zijn om ermee te werken.",[17,161,162],{},[20,163,41],{"href":38,"ariaDescribedBy":164,"dataFootnoteRef":25,"id":165},[24],"user-content-fnref-native-3",[10,167,168],{},"Dit is een optimalisatie binnen een bestaande serving-stack. Je hoeft er geen andere inference-server voor te gebruiken.",[10,170,171],{},[172,173],"img",{"alt":174,"src":175},"Integratieoverzicht: de originele, vastgelegde GGUF-gewichten, planning, sampling en streaming door vLLM, native uitvoering gecompileerd met Paiton en één Radeon AI PRO R9700. De gesloten compiler wordt niet meegeleverd.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-neo-gguf\u002F02-native-execution-neo-gguf.webp",[10,177,178,181],{},[31,179,180],{},"De publieke integratie in het kort: behoud de GGUF van de maker, serveer via vLLM en voer uit met Paiton op de R9700. Dit is een integratieoverzicht, geen beschrijving van de interne werking van de compiler.",[17,182,183],{},[20,184,41],{"href":38,"ariaDescribedBy":185,"dataFootnoteRef":25,"id":186},[24],"user-content-fnref-native-4",[82,188,190],{"id":189},"sneller-een-volledig-antwoord-niet-alleen-een-snellere-kernel","Sneller een volledig antwoord, niet alleen een snellere kernel",[10,192,193,194,197,198],{},"De vergelijking hieronder meet ",[13,195,196],{},"volledige streaming-HTTP-verzoeken",", met precies 128 gegenereerde tokens. Beide engines draaiden na elkaar op dezelfde R9700, zonder andere GPU-belasting. Per workload was er één opwarmverzoek, gevolgd door vijf gemeten verzoeken.",[17,199,200],{},[20,201,205],{"href":202,"ariaDescribedBy":203,"dataFootnoteRef":25,"id":204},"#user-content-fn-bench",[24],"user-content-fnref-bench","10",[10,207,208],{},[172,209],{"alt":210,"src":211},"Mediane responstijd na opwarmen, met 128 uitvoertokens. Bij 128 invoertokens: 5,264 seconden voor llama.cpp en 4,925 voor Paiton met vLLM, 6,4% lager. Bij 1.024 invoertokens: 5,933 tegenover 5,631 seconden, 5,1% lager. Bij 4.096 invoertokens: 9,099 tegenover 9,023 seconden, 0,8% lager en vrijwel gelijk. Eén opwarmverzoek en vijf metingen per workload.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-neo-gguf\u002F01-text-latency-neo-gguf.webp",[10,213,214,217],{},[31,215,216],{},"Volledige streamingverzoeken, niet alleen kerneltijden. Beide engines genereren precies 128 tokens. Het resultaat bij 4.096 invoertokens is vrijwel gelijk; deze steekproeven van vijf verzoeken tonen geen statistische significantie aan.",[17,218,219],{},[20,220,205],{"href":202,"ariaDescribedBy":221,"dataFootnoteRef":25,"id":222},[24],"user-content-fnref-bench-2",[224,225,226,246],"table",{},[227,228,229],"thead",{},[230,231,232,236,240,243],"tr",{},[233,234,235],"th",{},"Invoertokens",[233,237,239],{"align":238},"right","Mediaan llama.cpp",[233,241,242],{"align":238},"Mediaan Paiton + vLLM",[233,244,245],{"align":238},"Lagere responstijd",[247,248,249,268,286],"tbody",{},[230,250,251,255,258,263],{},[252,253,254],"td",{},"128",[252,256,257],{"align":238},"5,264 s",[252,259,260],{"align":238},[13,261,262],{},"4,925 s",[252,264,265],{"align":238},[13,266,267],{},"6,4%",[230,269,270,273,276,281],{},[252,271,272],{},"1.024",[252,274,275],{"align":238},"5,933 s",[252,277,278],{"align":238},[13,279,280],{},"5,631 s",[252,282,283],{"align":238},[13,284,285],{},"5,1%",[230,287,288,291,294,299],{},[252,289,290],{},"4.096",[252,292,293],{"align":238},"9,099 s",[252,295,296],{"align":238},[13,297,298],{},"9,023 s",[252,300,301],{"align":238},[13,302,303],{},"0,8%",[10,305,306,307],{},"Dit zijn metingen na het opwarmen, geen tijden voor een eerste installatie of koude start.",[17,308,309],{},[20,310,205],{"href":202,"ariaDescribedBy":311,"dataFootnoteRef":25,"id":312},[24],"user-content-fnref-bench-3",[10,314,315],{},"Bij 4.096 invoertokens spreken we het best van vrijwel gelijke prestaties. Een verschil van 76 milliseconden tussen de medianen van een kleine steekproef rechtvaardigt geen brede prestatieclaim.",[10,317,318,319],{},"Een lagere totale responstijd betekent ook niet dat elk onderdeel van elk verzoek sneller is. llama.cpp wint nog steeds enkele tests met één uitvoertoken, waarbij vooral de verwerking van de invoer, of prefill, de tijd bepaalt.",[17,320,321],{},[20,322,41],{"href":38,"ariaDescribedBy":323,"dataFootnoteRef":25,"id":324},[24],"user-content-fnref-native-5",[10,326,327],{},"Het bruikbare resultaat is dat deze GGUF binnen vLLM kan blijven en toch concurrerende responstijden haalt. In deze gemeten tests met volledige antwoorden waren die tijden ook lager.",[329,330,332],"h3",{"id":331},"wat-bleef-gelijk","Wat bleef gelijk?",[10,334,335,336],{},"De vergelijking gebruikte dezelfde vastgelegde GGUF, de oorspronkelijke tokenizer, een context van 8.192 tokens, prefill-blokken van 2.048 tokens en een BF16-KV-cache. Beide engines hadden één actieve sequentie, uitgeschakelde MTP en prefixcaching, en greedy sampling met vaste aantallen tokens. llama.cpp was een ongewijzigde HIP-build, geen CPU-fallback.",[17,337,338],{},[20,339,205],{"href":202,"ariaDescribedBy":340,"dataFootnoteRef":25,"id":341},[24],"user-content-fnref-bench-4",[10,343,344,345],{},"De prompts met vaste lengte zijn synthetische workloads voor tijdmetingen, geen benchmark voor programmeerproductiviteit. Korter redeneren of eerder stoppen wordt hier niet als snellere uitvoering meegeteld.",[17,346,347],{},[20,348,205],{"href":202,"ariaDescribedBy":349,"dataFootnoteRef":25,"id":350},[24],"user-content-fnref-bench-5",[82,352,354],{"id":353},"beeldinvoer-werkt-ook","Beeldinvoer werkt ook",[10,356,357,358],{},"Deze release accepteert ook één PNG- of JPEG-afbeelding via de chat-completions-interface. De beeldencoder draait via de native uitvoering van Paiton. Beeldembeddings en gegenereerde tekst delen hetzelfde contextbudget.",[17,359,360],{},[20,361,365],{"href":362,"ariaDescribedBy":363,"dataFootnoteRef":25,"id":364},"#user-content-fn-image",[24],"user-content-fnref-image","11",[10,367,368,369,372,373,376,377,380,381],{},"Voor een ",[13,370,371],{},"afbeelding van 1.024 × 1.024 pixels en 128 uitvoertokens"," bedroeg de mediane totale responstijd ",[13,374,375],{},"6,279 seconden met Paiton tegenover 6,455 seconden met llama.cpp",", ongeveer ",[13,378,379],{},"2,7% lager",". Daarin zitten beeldverwerking, prefill voor het taalmodel, generatie en serving-overhead.",[17,382,383],{},[20,384,41],{"href":38,"ariaDescribedBy":385,"dataFootnoteRef":25,"id":386},[24],"user-content-fnref-native-6",[10,388,389],{},[172,390],{"alt":391,"src":392},"Mediane totale responstijd voor één afbeelding en 128 uitvoertokens. Bij 256 bij 256 pixels: 5,111 seconden voor llama.cpp tegenover 4,909 seconden voor Paiton met vLLM, 4,0% lager. Bij 1.024 bij 1.024 pixels: 6,455 tegenover 6,279 seconden, 2,7% lager. Vijf gemeten verzoeken per test.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-neo-gguf\u002F03-image-latency-neo-gguf.webp",[10,394,395,398],{},[31,396,397],{},"Twee geteste beeldformaten, telkens gevolgd door 128 gegenereerde tokens. De tijd omvat beeldcodering, prefill voor het taalmodel, generatie en serving-overhead. Dit meet het begrijpen van beelden, niet het genereren ervan.",[17,399,400],{},[20,401,205],{"href":202,"ariaDescribedBy":402,"dataFootnoteRef":25,"id":403},[24],"user-content-fnref-bench-6",[224,405,406,419],{},[227,407,408],{},[230,409,410,413,415,417],{},[233,411,412],{},"Beeldformaat",[233,414,239],{"align":238},[233,416,242],{"align":238},[233,418,245],{"align":238},[247,420,421,439],{},[230,422,423,426,429,434],{},[252,424,425],{},"256 × 256",[252,427,428],{"align":238},"5,111 s",[252,430,431],{"align":238},[13,432,433],{},"4,909 s",[252,435,436],{"align":238},[13,437,438],{},"4,0%",[230,440,441,444,447,452],{},[252,442,443],{},"1.024 × 1.024",[252,445,446],{"align":238},"6,455 s",[252,448,449],{"align":238},[13,450,451],{},"6,279 s",[252,453,454],{"align":238},[13,455,456],{},"2,7%",[10,458,459,460],{},"Dit is inference met één afbeelding, geen ondersteuning voor video of onbeperkte aantallen afbeeldingen per verzoek.",[17,461,462],{},[20,463,365],{"href":362,"ariaDescribedBy":464,"dataFootnoteRef":25,"id":465},[24],"user-content-fnref-image-2",[82,467,469],{"id":468},"dezelfde-gewichten-betekenen-niet-identieke-berekeningen","Dezelfde gewichten betekenen niet identieke berekeningen",[10,471,472,473],{},"Een ongewijzigd GGUF-checkpoint maakt twee runtimes niet numeriek identiek. Het geteste uitvoeringsprofiel gebruikt voor activaties andere berekeningen dan de oudere FP32-referentie. De gewichtswaarden blijven ongewijzigd.",[17,474,475],{},[20,476,480],{"href":477,"ariaDescribedBy":478,"dataFootnoteRef":25,"id":479},"#user-content-fn-release",[24],"user-content-fnref-release","12",[10,482,483,484,487,488,491,492,498],{},"In de gepubliceerde controles slaagden ",[13,485,486],{},"10 van de 11 vaste teksttaken",", met dezelfde mislukte taak als bij llama.cpp, en ",[13,489,490],{},"alle vijf beeldtests",". De laatste prefill-optimalisatie leverde bovendien overeenkomende waarden op voor 31.784.960 vergeleken logits ten opzichte van het voorgaande gevalideerde Paiton-profiel, niet ten opzichte van elke andere engine.",[17,493,494],{},[20,495,480],{"href":477,"ariaDescribedBy":496,"dataFootnoteRef":25,"id":497},[24],"user-content-fnref-release-2",[17,499,500],{},[20,501,505],{"href":502,"ariaDescribedBy":503,"dataFootnoteRef":25,"id":504},"#user-content-fn-publication",[24],"user-content-fnref-publication","13",[10,507,508],{},"Dat zijn nuttige releasecontroles, geen bewijs dat de mogelijkheden voor elke programmeertaak, elk gesprek of elke afbeelding onveranderd zijn. We benoemen de numerieke vergelijkingen en hun referentieprofielen expliciet, in plaats van de release onder alle omstandigheden bit-identiek te noemen.",[82,510,512],{"id":511},"het-deploymentprofiel","Het deploymentprofiel",[10,514,515,516,522],{},"De gepubliceerde release v1.1.0 is gevalideerd voor de volgende configuratie:",[17,517,518],{},[20,519,480],{"href":477,"ariaDescribedBy":520,"dataFootnoteRef":25,"id":521},[24],"user-content-fnref-release-3",[17,523,524],{},[20,525,365],{"href":362,"ariaDescribedBy":526,"dataFootnoteRef":25,"id":527},[24],"user-content-fnref-image-3",[224,529,530,540],{},[227,531,532],{},[230,533,534,537],{},[233,535,536],{},"Instelling",[233,538,539],{},"Ondersteund profiel",[247,541,542,550,558,566,574,582,590],{},[230,543,544,547],{},[252,545,546],{},"GPU",[252,548,549],{},"Eén Radeon AI PRO R9700, gfx1201",[230,551,552,555],{},[252,553,554],{},"Model",[252,556,557],{},"Vastgelegde originele NEO CODER MAX Q4_K_M GGUF",[230,559,560,563],{},[252,561,562],{},"Runtime",[252,564,565],{},"Paiton; vastgelegde ROCm-versie 7.14.60850",[230,567,568,571],{},[252,569,570],{},"Context",[252,572,573],{},"In totaal 8.192 tokens",[230,575,576,579],{},[252,577,578],{},"Actieve sequenties",[252,580,581],{},"Eén; extra HTTP-verzoeken komen in de wachtrij",[230,583,584,587],{},[252,585,586],{},"Invoer",[252,588,589],{},"Tekst, of tekst met één PNG\u002FJPEG-afbeelding",[230,591,592,595],{},[252,593,594],{},"MTP, prefixcaching, video",[252,596,597],{},"Uitgeschakeld",[10,599,600,601,604],{},"De modelnaam bevat MTP, maar deze resultaten gebruiken ",[13,602,603],{},"geen"," speculatieve MTP-decoding. Ook moet je clients in een wachtrij niet verwarren met gevalideerde GPU-batching van meerdere sequenties tegelijk.",[10,606,607,608],{},"Deze release richt zich op de R9700 met 32 GB. Dat is geen toezegging van ondersteuning voor een kleinere GPU, een andere GGUF-kwantisatie, langere contexten of veel gelijktijdige verzoeken.",[17,609,610],{},[20,611,27],{"href":22,"ariaDescribedBy":612,"dataFootnoteRef":25,"id":613},[24],"user-content-fnref-readme-2",[82,615,617],{"id":616},"start-met-de-gepubliceerde-release","Start met de gepubliceerde release",[10,619,620],{},[172,621],{"alt":622,"src":623},"Het gevalideerde lokale profiel: één Radeon AI PRO R9700, Linux en Docker, een context van 8.192 tokens, één actieve sequentie en tekst of één PNG\u002FJPEG-afbeelding. Een schematische API-weergave toont het lokale chat-completions-endpoint en de modelnaam qwen38-neo. Dit is geen screenshot van een toepassing.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-neo-gguf\u002F05-local-endpoint-neo-gguf.webp",[10,625,626,629],{},[31,627,628],{},"Het gevalideerde lokale serving-profiel. Het API-paneel is illustratief, geen screenshot van een toepassing of benchmarkregistratie. Je hebt geen toegang tot de compiler nodig om de gepubliceerde runtime te gebruiken.",[17,630,631],{},[20,632,480],{"href":477,"ariaDescribedBy":633,"dataFootnoteRef":25,"id":634},[24],"user-content-fnref-release-4",[10,636,637,638,644],{},"Op een Linux-systeem met een R9700, een werkende AMD-driver en GPU-toegang vanuit Docker kun je de publieke repository met hulpscripts klonen en de vastgelegde containerimage van release v1.1.0 starten:",[17,639,640],{},[20,641,27],{"href":22,"ariaDescribedBy":642,"dataFootnoteRef":25,"id":643},[24],"user-content-fnref-readme-3",[17,645,646],{},[20,647,480],{"href":477,"ariaDescribedBy":648,"dataFootnoteRef":25,"id":649},[24],"user-content-fnref-release-5",[651,652,656],"pre",{"className":653,"code":654,"language":655,"meta":25,"style":25},"language-bash shiki shiki-themes github-light github-dark","git clone --depth 1 https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin.git\ncd paiton-vllm-plugin\n\nPAITON_NEO_IMAGE=ghcr.io\u002Feliovp\u002Fpaiton-vllm-plugin@sha256:534287969135f581744ae481b578599468b0bf7ac9a4051b0941500e4c18da4d \\\n  .\u002Fmodels\u002FQwen3.8-NEO-CODER-MAX\u002Fserve-docker.sh\n","bash",[90,657,658,681,690,697,714],{"__ignoreMap":25},[659,660,663,667,671,675,678],"span",{"class":661,"line":662},"line",1,[659,664,666],{"class":665},"sScJk","git",[659,668,670],{"class":669},"sZZnC"," clone",[659,672,674],{"class":673},"sj4cs"," --depth",[659,676,677],{"class":673}," 1",[659,679,680],{"class":669}," https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin.git\n",[659,682,684,687],{"class":661,"line":683},2,[659,685,686],{"class":673},"cd",[659,688,689],{"class":669}," paiton-vllm-plugin\n",[659,691,693],{"class":661,"line":692},3,[659,694,696],{"emptyLinePlaceholder":695},true,"\n",[659,698,700,704,708,711],{"class":661,"line":699},4,[659,701,703],{"class":702},"sVt8B","PAITON_NEO_IMAGE",[659,705,707],{"class":706},"szBVR","=",[659,709,710],{"class":669},"ghcr.io\u002Feliovp\u002Fpaiton-vllm-plugin@sha256:534287969135f581744ae481b578599468b0bf7ac9a4051b0941500e4c18da4d",[659,712,713],{"class":665}," \\\n",[659,715,717],{"class":661,"line":716},5,[659,718,719],{"class":669},"  .\u002Fmodels\u002FQwen3.8-NEO-CODER-MAX\u002Fserve-docker.sh\n",[10,721,722,723,726,727],{},"Bij de eerste start wordt ongeveer ",[13,724,725],{},"19,43 GB"," aan vastgelegde model- en projectorbestanden gedownload. Latere starts hergebruiken de cache en controleren de hashes. De broncode van de compiler is niet nodig. Heb je al exact dezelfde vastgelegde GGUF, dan kun je die koppelen en hergebruiken volgens de instructies in de modelhandleiding.",[17,728,729],{},[20,730,27],{"href":22,"ariaDescribedBy":731,"dataFootnoteRef":25,"id":732},[24],"user-content-fnref-readme-4",[10,734,735],{},"Zodra de server klaar is, kun je vanuit een andere terminal een verzoek sturen:",[651,737,739],{"className":653,"code":738,"language":655,"meta":25,"style":25},"curl http:\u002F\u002F127.0.0.1:8000\u002Fv1\u002Fchat\u002Fcompletions \\\n  -H 'Content-Type: application\u002Fjson' \\\n  -d '{\n    \"model\": \"qwen38-neo\",\n    \"messages\": [\n      {\n        \"role\": \"user\",\n        \"content\": \"Write a Python function that removes duplicate integers while preserving their original order.\"\n      }\n    ],\n    \"temperature\": 0,\n    \"max_tokens\": 256,\n    \"stream\": true,\n    \"chat_template_kwargs\": {\"enable_thinking\": false}\n  }'\n",[90,740,741,751,761,769,774,779,785,791,797,803,809,815,821,827,833],{"__ignoreMap":25},[659,742,743,746,749],{"class":661,"line":662},[659,744,745],{"class":665},"curl",[659,747,748],{"class":669}," http:\u002F\u002F127.0.0.1:8000\u002Fv1\u002Fchat\u002Fcompletions",[659,750,713],{"class":673},[659,752,753,756,759],{"class":661,"line":683},[659,754,755],{"class":673},"  -H",[659,757,758],{"class":669}," 'Content-Type: application\u002Fjson'",[659,760,713],{"class":673},[659,762,763,766],{"class":661,"line":692},[659,764,765],{"class":673},"  -d",[659,767,768],{"class":669}," '{\n",[659,770,771],{"class":661,"line":699},[659,772,773],{"class":669},"    \"model\": \"qwen38-neo\",\n",[659,775,776],{"class":661,"line":716},[659,777,778],{"class":669},"    \"messages\": [\n",[659,780,782],{"class":661,"line":781},6,[659,783,784],{"class":669},"      {\n",[659,786,788],{"class":661,"line":787},7,[659,789,790],{"class":669},"        \"role\": \"user\",\n",[659,792,794],{"class":661,"line":793},8,[659,795,796],{"class":669},"        \"content\": \"Write a Python function that removes duplicate integers while preserving their original order.\"\n",[659,798,800],{"class":661,"line":799},9,[659,801,802],{"class":669},"      }\n",[659,804,806],{"class":661,"line":805},10,[659,807,808],{"class":669},"    ],\n",[659,810,812],{"class":661,"line":811},11,[659,813,814],{"class":669},"    \"temperature\": 0,\n",[659,816,818],{"class":661,"line":817},12,[659,819,820],{"class":669},"    \"max_tokens\": 256,\n",[659,822,824],{"class":661,"line":823},13,[659,825,826],{"class":669},"    \"stream\": true,\n",[659,828,830],{"class":661,"line":829},14,[659,831,832],{"class":669},"    \"chat_template_kwargs\": {\"enable_thinking\": false}\n",[659,834,836],{"class":661,"line":835},15,[659,837,838],{"class":669},"  }'\n",[10,840,841,842],{},"Het voorbeeld schakelt thinking expliciet uit via het behouden oorspronkelijke template. Het is een interactief voorbeeld, niet het benchmarkverzoek met precies 128 uitvoertokens.",[17,843,844],{},[20,845,27],{"href":22,"ariaDescribedBy":846,"dataFootnoteRef":25,"id":847},[24],"user-content-fnref-readme-5",[82,849,851],{"id":850},"meer-uit-je-hardware-zonder-een-andere-serving-stack","Meer uit je hardware, zonder een andere serving-stack",[10,853,854],{},"Niet elk model heeft een nieuwe engine nodig. Een waardevolle fine-tune zou zijn identiteit niet moeten verliezen om efficiënt ingezet te kunnen worden.",[10,856,857,858],{},"In deze release blijven de originele GGUF en vLLM behouden. Paiton verandert de uitvoering die eronder ligt.",[17,859,860],{},[20,861,41],{"href":38,"ariaDescribedBy":862,"dataFootnoteRef":25,"id":863},[24],"user-content-fnref-native-7",[10,865,866],{},[13,867,868],{},"Behoud de fine-tune. Behoud vLLM. Haal meer uit de Radeon die je al hebt.",[10,870,871,872,93,876],{},"Begin met de publieke modelhandleiding en het benchmarkrapport. Voor AMD-inference buiten dit gevalideerde profiel kun je met ons in gesprek over ",[20,873,875],{"href":874},"\u002Fnl\u002Fproducts\u002Fpaiton","Paiton",[17,877,878],{},[20,879,27],{"href":22,"ariaDescribedBy":880,"dataFootnoteRef":25,"id":881},[24],"user-content-fnref-readme-6",[883,884],"hr",{},[886,887,890,895],"section",{"className":888,"dataFootnotes":25},[889],"footnotes",[82,891,894],{"className":892,"id":24},[893],"sr-only","Footnotes",[896,897,898,952,1007,1021,1034,1048,1061,1074,1087,1100,1148,1175,1216],"ol",{},[899,900,902,908,909,916,917,916,924,916,931,916,938,916,945],"li",{"id":901},"user-content-fn-readme",[20,903,907],{"href":904,"rel":905},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-NEO-CODER-MAX\u002FREADME.md",[906],"nofollow","Paiton NEO-modelhandleiding",". ",[20,910,915],{"href":911,"ariaLabel":912,"className":913,"dataFootnoteBackref":25},"#user-content-fnref-readme","Back to reference 1",[914],"data-footnote-backref","↩"," ",[20,918,915,922],{"href":919,"ariaLabel":920,"className":921,"dataFootnoteBackref":25},"#user-content-fnref-readme-2","Back to reference 1-2",[914],[17,923,41],{},[20,925,915,929],{"href":926,"ariaLabel":927,"className":928,"dataFootnoteBackref":25},"#user-content-fnref-readme-3","Back to reference 1-3",[914],[17,930,52],{},[20,932,915,936],{"href":933,"ariaLabel":934,"className":935,"dataFootnoteBackref":25},"#user-content-fnref-readme-4","Back to reference 1-4",[914],[17,937,60],{},[20,939,915,943],{"href":940,"ariaLabel":941,"className":942,"dataFootnoteBackref":25},"#user-content-fnref-readme-5","Back to reference 1-5",[914],[17,944,101],{},[20,946,915,950],{"href":947,"ariaLabel":948,"className":949,"dataFootnoteBackref":25},"#user-content-fnref-readme-6","Back to reference 1-6",[914],[17,951,112],{},[899,953,955,908,960,916,965,916,972,916,979,916,986,916,993,916,1000],{"id":954},"user-content-fn-native",[20,956,959],{"href":957,"rel":958},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-NEO-CODER-MAX\u002FNATIVE_GGUF.md",[906],"Native GGUF via vLLM op AMD RDNA4",[20,961,915],{"href":962,"ariaLabel":963,"className":964,"dataFootnoteBackref":25},"#user-content-fnref-native","Back to reference 2",[914],[20,966,915,970],{"href":967,"ariaLabel":968,"className":969,"dataFootnoteBackref":25},"#user-content-fnref-native-2","Back to reference 2-2",[914],[17,971,41],{},[20,973,915,977],{"href":974,"ariaLabel":975,"className":976,"dataFootnoteBackref":25},"#user-content-fnref-native-3","Back to reference 2-3",[914],[17,978,52],{},[20,980,915,984],{"href":981,"ariaLabel":982,"className":983,"dataFootnoteBackref":25},"#user-content-fnref-native-4","Back to reference 2-4",[914],[17,985,60],{},[20,987,915,991],{"href":988,"ariaLabel":989,"className":990,"dataFootnoteBackref":25},"#user-content-fnref-native-5","Back to reference 2-5",[914],[17,992,101],{},[20,994,915,998],{"href":995,"ariaLabel":996,"className":997,"dataFootnoteBackref":25},"#user-content-fnref-native-6","Back to reference 2-6",[914],[17,999,112],{},[20,1001,915,1005],{"href":1002,"ariaLabel":1003,"className":1004,"dataFootnoteBackref":25},"#user-content-fnref-native-7","Back to reference 2-7",[914],[17,1006,126],{},[899,1008,1010,1015,1016],{"id":1009},"user-content-fn-model",[20,1011,1014],{"href":1012,"rel":1013},"https:\u002F\u002Fhuggingface.co\u002FDavidAU\u002FQwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF",[906],"Modelkaart van DavidAU",", downloadcijfer gecontroleerd op 14 september 2026. ",[20,1017,915],{"href":1018,"ariaLabel":1019,"className":1020,"dataFootnoteBackref":25},"#user-content-fnref-model","Back to reference 3",[914],[899,1022,1024,908,1029],{"id":1023},"user-content-fn-downloads",[20,1025,1028],{"href":1026,"rel":1027},"https:\u002F\u002Fhuggingface.co\u002Fdocs\u002Fhub\u002Fmodels-download-stats",[906],"Hugging Face: uitleg over downloadstatistieken",[20,1030,915],{"href":1031,"ariaLabel":1032,"className":1033,"dataFootnoteBackref":25},"#user-content-fnref-downloads","Back to reference 4",[914],[899,1035,1037,1042,1043],{"id":1036},"user-content-fn-vllm",[20,1038,1041],{"href":1039,"rel":1040},"https:\u002F\u002Fdocs.vllm.ai\u002Fen\u002Fstable\u002Ffeatures\u002Fquantization\u002Fgguf\u002F",[906],"vLLM: GGUF-documentatie",", geraadpleegd op 14 september 2026. ",[20,1044,915],{"href":1045,"ariaLabel":1046,"className":1047,"dataFootnoteBackref":25},"#user-content-fnref-vllm","Back to reference 5",[914],[899,1049,1051,908,1056],{"id":1050},"user-content-fn-upstream",[20,1052,1055],{"href":1053,"rel":1054},"https:\u002F\u002Fgithub.com\u002Fvllm-project\u002Fvllm-gguf-plugin",[906],"Upstream vllm-gguf-plugin",[20,1057,915],{"href":1058,"ariaLabel":1059,"className":1060,"dataFootnoteBackref":25},"#user-content-fnref-upstream","Back to reference 6",[914],[899,1062,1064,908,1069],{"id":1063},"user-content-fn-gguf",[20,1065,1068],{"href":1066,"rel":1067},"https:\u002F\u002Fhuggingface.co\u002Fdocs\u002Fhub\u002Fgguf",[906],"Hugging Face: GGUF",[20,1070,915],{"href":1071,"ariaLabel":1072,"className":1073,"dataFootnoteBackref":25},"#user-content-fnref-gguf","Back to reference 7",[914],[899,1075,1077,908,1082],{"id":1076},"user-content-fn-llama",[20,1078,1081],{"href":1079,"rel":1080},"https:\u002F\u002Fgithub.com\u002Fggml-org\u002Fllama.cpp",[906],"llama.cpp",[20,1083,915],{"href":1084,"ariaLabel":1085,"className":1086,"dataFootnoteBackref":25},"#user-content-fnref-llama","Back to reference 8",[914],[899,1088,1090,908,1095],{"id":1089},"user-content-fn-lock",[20,1091,1094],{"href":1092,"rel":1093},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-NEO-CODER-MAX\u002Fcheckpoint.lock.json",[906],"Vastgelegd checkpoint",[20,1096,915],{"href":1097,"ariaLabel":1098,"className":1099,"dataFootnoteBackref":25},"#user-content-fnref-lock","Back to reference 9",[914],[899,1101,1103,908,1108,916,1113,916,1120,916,1127,916,1134,916,1141],{"id":1102},"user-content-fn-bench",[20,1104,1107],{"href":1105,"rel":1106},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-NEO-CODER-MAX\u002FBENCHMARKS.md",[906],"Benchmarks voor NEO v1.1.0",[20,1109,915],{"href":1110,"ariaLabel":1111,"className":1112,"dataFootnoteBackref":25},"#user-content-fnref-bench","Back to reference 10",[914],[20,1114,915,1118],{"href":1115,"ariaLabel":1116,"className":1117,"dataFootnoteBackref":25},"#user-content-fnref-bench-2","Back to reference 10-2",[914],[17,1119,41],{},[20,1121,915,1125],{"href":1122,"ariaLabel":1123,"className":1124,"dataFootnoteBackref":25},"#user-content-fnref-bench-3","Back to reference 10-3",[914],[17,1126,52],{},[20,1128,915,1132],{"href":1129,"ariaLabel":1130,"className":1131,"dataFootnoteBackref":25},"#user-content-fnref-bench-4","Back to reference 10-4",[914],[17,1133,60],{},[20,1135,915,1139],{"href":1136,"ariaLabel":1137,"className":1138,"dataFootnoteBackref":25},"#user-content-fnref-bench-5","Back to reference 10-5",[914],[17,1140,101],{},[20,1142,915,1146],{"href":1143,"ariaLabel":1144,"className":1145,"dataFootnoteBackref":25},"#user-content-fnref-bench-6","Back to reference 10-6",[914],[17,1147,112],{},[899,1149,1151,908,1156,916,1161,916,1168],{"id":1150},"user-content-fn-image",[20,1152,1155],{"href":1153,"rel":1154},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-NEO-CODER-MAX\u002FIMAGE_API.md",[906],"Beeld-API",[20,1157,915],{"href":1158,"ariaLabel":1159,"className":1160,"dataFootnoteBackref":25},"#user-content-fnref-image","Back to reference 11",[914],[20,1162,915,1166],{"href":1163,"ariaLabel":1164,"className":1165,"dataFootnoteBackref":25},"#user-content-fnref-image-2","Back to reference 11-2",[914],[17,1167,41],{},[20,1169,915,1173],{"href":1170,"ariaLabel":1171,"className":1172,"dataFootnoteBackref":25},"#user-content-fnref-image-3","Back to reference 11-3",[914],[17,1174,52],{},[899,1176,1178,908,1183,916,1188,916,1195,916,1202,916,1209],{"id":1177},"user-content-fn-release",[20,1179,1182],{"href":1180,"rel":1181},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-NEO-CODER-MAX\u002Fpaiton-release.json",[906],"Releasemanifest v1.1.0",[20,1184,915],{"href":1185,"ariaLabel":1186,"className":1187,"dataFootnoteBackref":25},"#user-content-fnref-release","Back to reference 12",[914],[20,1189,915,1193],{"href":1190,"ariaLabel":1191,"className":1192,"dataFootnoteBackref":25},"#user-content-fnref-release-2","Back to reference 12-2",[914],[17,1194,41],{},[20,1196,915,1200],{"href":1197,"ariaLabel":1198,"className":1199,"dataFootnoteBackref":25},"#user-content-fnref-release-3","Back to reference 12-3",[914],[17,1201,52],{},[20,1203,915,1207],{"href":1204,"ariaLabel":1205,"className":1206,"dataFootnoteBackref":25},"#user-content-fnref-release-4","Back to reference 12-4",[914],[17,1208,60],{},[20,1210,915,1214],{"href":1211,"ariaLabel":1212,"className":1213,"dataFootnoteBackref":25},"#user-content-fnref-release-5","Back to reference 12-5",[914],[17,1215,101],{},[899,1217,1219,908,1224],{"id":1218},"user-content-fn-publication",[20,1220,1223],{"href":1221,"rel":1222},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-NEO-CODER-MAX\u002Fpublication-checks.json",[906],"Publicatiecontroles",[20,1225,915],{"href":1226,"ariaLabel":1227,"className":1228,"dataFootnoteBackref":25},"#user-content-fnref-publication","Back to reference 13",[914],[1230,1231,1232],"style",{},"html pre.shiki code .sScJk, html code.shiki .sScJk{--shiki-default:#6F42C1;--shiki-dark:#B392F0}html pre.shiki code .sZZnC, html code.shiki .sZZnC{--shiki-default:#032F62;--shiki-dark:#9ECBFF}html pre.shiki code .sj4cs, html code.shiki .sj4cs{--shiki-default:#005CC5;--shiki-dark:#79B8FF}html pre.shiki code .sVt8B, html code.shiki .sVt8B{--shiki-default:#24292E;--shiki-dark:#E1E4E8}html pre.shiki code .szBVR, html code.shiki .szBVR{--shiki-default:#D73A49;--shiki-dark:#F97583}html .default .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}html.dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}",{"title":25,"searchDepth":683,"depth":683,"links":1234},[1235,1236,1237,1240,1241,1242,1243,1244,1245],{"id":84,"depth":683,"text":85},{"id":144,"depth":683,"text":145},{"id":189,"depth":683,"text":190,"children":1238},[1239],{"id":331,"depth":692,"text":332},{"id":353,"depth":683,"text":354},{"id":468,"depth":683,"text":469},{"id":511,"depth":683,"text":512},{"id":616,"depth":683,"text":617},{"id":850,"depth":683,"text":851},{"id":24,"depth":683,"text":894},[875,1247,1248,1249,1250],"AMD Radeon","Lokale AI","GGUF","vLLM","2026-09-14T07:30:00Z","Draai de originele NEO CODER MAX GGUF met Paiton in vLLM op een R9700. Bekijk de gemeten responstijden, beeldinvoer en lokale installatie.","md",null,"\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-neo-gguf\u002F00-hero-neo-gguf-r9700.webp",{},"https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700","\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700",{"title":5,"description":1252},"paiton-qwen38-neo-gguf-vllm-r9700","blog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700","52FU1PSlokHeFyM0sHxbGW11h79LsdaYleJC5Xrxy2w",[1264,1276,1278,1290,1301,1314,1323,1337,1368,1380,1402,1420,1439,1458,1476,1493,1505,1521,1536,1548,1557,1565,1580,1592,1603,1614,1624,1637,1647,1659,1670,1680,1691,1700,1712,1723,1732],{"path":1265,"title":1266,"description":1267,"date":1268,"slug":1269,"image":1270,"originalUrl":1271,"categories":1272},"\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700","Qwen3.8: 400,7 tok\u002Fs op één R9700 | Paiton","Qwen3.8 op één R9700: 400,7 tok\u002Fs met ROCm 10 en vLLM 0.29, plus publieke 200K\u002F220K-chatprofielen. Benchmarks, beperkingen en startopdrachten.","2026-09-16T07:30:00Z","paiton-qwen38-mxfp4-dflash2-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002Fupdate-2026-09-19\u002Fhero.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700",[875,1247,1248,1273,1274,1275,1250],"AI-inferentie","Inferentie-optimalisatie","Grote taalmodellen",{"path":1258,"title":5,"description":1252,"date":1251,"slug":1260,"image":1255,"originalUrl":1257,"categories":1277},[875,1247,1248,1249,1250],{"path":1279,"title":1280,"description":1281,"date":1282,"slug":1283,"image":1284,"originalUrl":1285,"categories":1286},"\u002Fblog\u002Fpaiton-minimax-h3-radeon-ai-pro-r9700","MiniMax H3 op Radeon: 15 seconden video met stereogeluid","Paiton genereert lokaal 15 seconden MiniMax H3-video met stereogeluid op één Radeon AI PRO R9700 in 5 min 33 s, met 16,7% minder wachttijd dan stock.","2026-09-09T07:30:00Z","paiton-minimax-h3-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-minimax-h3\u002F00-featured-minimax-h3-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-minimax-h3-radeon-ai-pro-r9700",[875,1247,1248,1287,1288,1289],"Videogeneratie","MiniMax H3","ComfyUI",{"path":1291,"title":1292,"description":1293,"date":1294,"slug":1295,"image":1296,"originalUrl":1297,"categories":1298},"\u002Fblog\u002Fpaiton-flux2-klein-radeon-ai-pro-r9700","Lokale FLUX.2 klein op Radeon AI PRO R9700: sneller beelden genereren met minder VRAM","Paiton genereert FLUX.2 klein-beelden van 1024 × 1024 in 1,054 seconden op een R9700, met 16,2% minder generatietijd en 33,4% minder piekallocatie in Torch.","2026-09-07T09:00:00","paiton-flux2-klein-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-flux2-klein\u002Ffox-paiton.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-flux2-klein-radeon-ai-pro-r9700",[875,1247,1248,1299,1300,1289],"Beeldgeneratie","FLUX",{"path":1302,"title":1303,"description":1304,"date":1305,"slug":1306,"image":1307,"originalUrl":1308,"categories":1309},"\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700","Ornith 1.5 haalt 44,6 tok\u002Fs op één Radeon AI PRO R9700","Paiton draait Ornith 1.5 35B A3B op één Radeon AI PRO R9700 met 44,63 outputtokens per seconde, 27% sneller en met 21,3% lagere gemodelleerde kosten.","2026-09-05T09:00:00","paiton-ornith15-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F00-featured-ornith15-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700",[875,1310,1247,1273,1311,1312,1274,1275,1250,1313],"Kunstmatige intelligentie","GPU-prestaties","Inferentielatentie","Kostenefficiëntie",{"path":1315,"title":1316,"description":1317,"date":1318,"slug":1319,"image":1320,"originalUrl":1321,"categories":1322},"\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700","Paiton: 21% meer Qwen3.8-doorvoer op Radeon AI PRO R9700","Paiton draait AMD's Qwen3.8 27B op één Radeon AI PRO R9700 met 39,77 outputtokens per seconde. Dat levert 21% meer throughput en 17,4% lagere gemodelleerde kosten op.","2026-09-04T09:00:00","paiton-qwen38-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-r9700\u002F00-featured-paiton-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700",[875,1310,1247,1273,1311,1312,1274,1275,1250,1313],{"path":1324,"title":1325,"description":1326,"date":1327,"slug":1328,"image":1329,"originalUrl":1254,"categories":1330},"\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt","Stroomvereisten voor AI-datacenters: de GPU-per-MW-illusie","Waarom verschillen GPU-aantallen per megawatt? Lees hoe PUE, piekbelasting, opslag, netwerken en koeling de inzetbare AI-capaciteit bepalen.","2026-07-27T23:52:00","ai-data-center-power-requirements-gpu-per-megawatt","\u002Fasset\u002Fimages\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt\u002Fgpu-per-megawatt-illusion.webp",[1331,1332,1333,1334,1335,1336],"Alle","AI-infrastructuur","Datacenters","ModFlex","HPC","AMD Helios",{"path":1338,"title":1339,"description":1340,"date":1341,"slug":1342,"image":1343,"originalUrl":1344,"categories":1345},"\u002Fblog\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","Wan2.2-videogeneratie: Paiton op AMD MI355X","Vergelijk Wan2.2-videogeneratie op AMD MI355X met Paiton en NVIDIA B200 via Diffusers. Lees hoe we diffusiemodellen optimaliseren.","2026-06-10T14:04:04","paiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonwan2.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x\u002F",[1331,1310,875,1346,1347,1348,1349,1350,1351,1352,1353,1354,546,1355,1356,1357,1358,1359,1360,1361,875,1362,1363,1364,1365,1366,1367],"14B","AMD","B200","Benchmarks","Blackwell","Compute","Diffusie","Eliovp","Generatieve AI","Hardware","Inferentie","Instinct","MI355x","NVIDIA","On-premises","Optimalisatie","Soevereine AI","T2V","Tekst-naar-video","Tuning","Video-generatie","Wan2.2",{"path":1369,"title":1370,"description":1371,"date":1372,"slug":1373,"image":1374,"originalUrl":1375,"categories":1376},"\u002Fblog\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","ElioVP in De Tijd: chipoptimalisatie en datacenters","Lees hoe De Tijd ElioVP belicht, van de oorsprong in chipoptimalisatie tot het werk aan modulaire datacenters en koeling voor hoge vermogensdichtheid.","2026-02-10T20:48:12","from-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fphysicalnewspaper.webp","https:\u002F\u002Feliovp.com\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure\u002F",[1331,1310,1377,1378,1347,1379,1377,1359],"Modulaire DC","Niet gecategoriseerd","De Tijd",{"path":1381,"title":1382,"description":1383,"date":1384,"slug":1385,"image":1386,"originalUrl":1387,"categories":1388},"\u002Fblog\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","AI en privacy: een strategische prioriteit in de Benelux","Privacyrisico's van generatieve AI, vertrouwen, dataopslag en governance. Waarom bedrijven in de Benelux veilige AI strategisch moeten benaderen.","2026-01-29T13:51:11","privacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fheaderimage.webp","https:\u002F\u002Feliovp.com\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit\u002F",[1331,1310,1389,1378,1390,1391,1392,1393,1394,1395,1396,1397,1353,1398,1354,1399,1400,1401],"Trending","AI Act","Antropomorfisme","AVG","Benelux","ChatGPT","Cyberbeveiliging","Databeheer","Gegevensbeveiliging","GDPR","Microsoft Copilot","Privacy","Shadow AI",{"path":1403,"title":1404,"description":1405,"date":1406,"slug":1407,"image":1408,"originalUrl":1409,"categories":1410},"\u002Fblog\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","Waarom wij itsme niet gebruiken: privacy en soevereiniteit","Waarom ElioVP itsme niet gebruikt: onze afwegingen rond identiteitsmetadata, cloudafhankelijkheid, privacy en datasoevereiniteit.","2025-11-27T09:32:14","itsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontimage.webp","https:\u002F\u002Feliovp.com\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom\u002F",[1331,1411,1412,1413,1395,1414,1415,1416,1398,1417,1418,1419,1400],"AWS","Belgian Mobile ID","CLOUD Act","Datasoevereiniteit","Digitale identiteit","eIDAS","itsme","Liberty Global","MyGov.be",{"path":1421,"title":1422,"description":1423,"date":1424,"slug":1425,"image":1426,"originalUrl":1427,"categories":1428},"\u002Fblog\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025","Praktijkrapport: de realiteit van Agentic AI bouwen in 2025","Praktijklessen over lokale AI-agents in 2025 gaan in op workflowontwerp, observability, modeltraining, hallucinaties en GPU-geheugenlimieten.","2025-11-25T14:03:39","field-report-the-reality-of-building-agentic-ai-in-2025","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffieldreport.webp","https:\u002F\u002Feliovp.com\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025\u002F",[1331,1310,1429,1389,1430,1431,1432,1433,1434,1435,1436,1437,1362,1438],"Oplossingen","Agentic AI","AI-techniek","AI-strategie","Autonome agenten","Bedrijfs-AI","Lokale LLM","Modelverfijning","AI op locatie","VRAM-optimalisatie",{"path":1440,"title":1441,"description":1442,"date":1443,"slug":1444,"image":1445,"originalUrl":1446,"categories":1447},"\u002Fblog\u002Fthe-synthetic-unicorn-bubble","De synthetische unicornzeepbel","Een analyse van investeringsrisico’s bij AI-neoclouds: circulaire financiering, infrastructuurclaims, contractvoorwaarden en due diligence.","2025-11-24T19:22:28","the-synthetic-unicorn-bubble","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsyntheticunicorn.webp","https:\u002F\u002Feliovp.com\u002Fthe-synthetic-unicorn-bubble\u002F",[1331,1310,1389,1448,1449,1450,1451,1452,1453,1454,1455,1456,1457],"AI Infrastructure","AI Neocloud","Circulaire financiering","GPU Cloud","Beleggingsrisico's","Opstartwaardering","Synthetische bubbel","Technische analyse","Vaporware","Durfkapitaal",{"path":1459,"title":1460,"description":1461,"date":1462,"slug":1463,"image":1464,"originalUrl":1465,"categories":1466},"\u002Fblog\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","NVIDIA GB300 NVL72: modulair datacenter in vier maanden","Ontdek een modulair datacenterontwerp voor NVIDIA GB300 NVL72, met redundante voeding, hybride koeling en een bouwplanning van vier maanden.","2025-11-20T14:10:19","building-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsuperpodmodflexfrontimage.webp","https:\u002F\u002Feliovp.com\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power\u002F",[1331,1377,1378,1467,1332,1468,1469,1470,1471,1472,1473,1474,1475],"150 kW-rack","DLC","Hoge dichtheid","Vloeistofkoeling","Modulair datacenter","NVIDIA Blackwell Ultra","NVIDIA GB300","NVL72","Snelle implementatie",{"path":1477,"title":1478,"description":1479,"date":1480,"slug":1481,"image":1482,"originalUrl":1483,"categories":1484},"\u002Fblog\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential","CUDA-vertaling versus AMD-gerichte optimalisatie","Waarom CUDA-compatibiliteit niet hetzelfde is als AMD-prestaties: over ROCm, HIP, kerneloptimalisatie en hardwaregerichte afstemming.","2025-11-12T14:48:37","why-cuda-translation-wont-unlock-amds-real-potential","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fchatgpt-image-nov-11-2025-09_16_10-pm-1.webp","https:\u002F\u002Feliovp.com\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential\u002F",[1331,1310,875,1378,1485,1310,1486,1487,1488,1489,1490,1491,875,1492],"AMD MI300X","CUDA-vertaling","FP8","GPU-optimalisatie","High-performance computing","HIP","Kerneltuning","ROCm",{"path":1494,"title":1495,"description":1496,"date":1497,"slug":1498,"image":1499,"originalUrl":1500,"categories":1501},"\u002Fblog\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference","Paiton: snellere AI-inferentie in uw bestaande stack","Lees hoe Paiton aansluit op bestaande inferentiestacks, met AMD MI300X-benchmarks en vergelijkingen van prestaties per dollar.","2025-11-11T10:31:22","paiton-the-simplest-way-to-supercharge-ai-inference","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton-powaaah.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference\u002F",[1331,1310,875,1273,1502,1485,1313,1503,1274,1491,875,1504,1250],"AMD Instinct","Hoge throughput","SGLang",{"path":1506,"title":1507,"description":1508,"date":1509,"slug":1510,"image":1511,"originalUrl":1512,"categories":1513},"\u002Fblog\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","Paiton MoE-benchmarks: MI300X versus H200 en B200","Vergelijk Qwen3-30B-A3B MoE-benchmarks van MI300X met Paiton, H200 en B200: throughput en kosten per miljoen tokens.","2025-09-26T13:36:18","stop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhulkvshulkpaitonwins.webp","https:\u002F\u002Feliovp.com\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens\u002F",[1331,1310,875,1514,1485,1515,1274,1516,1517,1518,1519,875,1520],"AI-benchmarks","Kosten per token","Mixture of Experts","MoE","NVIDIA B200","NVIDIA H200","Qwen3",{"path":1522,"title":1523,"description":1524,"date":1525,"slug":1526,"image":1527,"originalUrl":1528,"categories":1529},"\u002Fblog\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","Lokale Agentic AI: van inbox naar actie","Lokale AI-agents zetten e-mails, documenten en beelden om in tickets, rapporten en acties, met modellen op maat van uw gegevens en systemen.","2025-09-16T13:09:00","agentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontfotoblog.webp","https:\u002F\u002Feliovp.com\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en\u002F",[1331,1310,1429,1378,1430,1530,1531,1532,1533,1435,1437,1362,1534,1535],"Schadedetectie","Documentverwerking","E-mailautomatisering","Factuurextractie","Ticketautomatisering","Workflowautomatisering",{"path":1537,"title":1538,"description":1539,"date":1540,"slug":1541,"image":1542,"originalUrl":1543,"categories":1544},"\u002Fblog\u002Fmi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","MI300X FP8-benchmarks: GPU-partitionering met Paiton","Bekijk hoe Paiton presteert met Llama 3.1 8B FP8 op gepartitioneerde MI300X-GPU's, vergeleken met NVIDIA H200 en B200.","2025-07-31T13:32:57","mi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fimage-2-1.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-fp8-data%e2%80%91parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach\u002F",[1331,1310,875,1378,1545,1347,1348,1546,1547,1358,1359,875,1250],"AI","H200","MI300X",{"path":1549,"title":1550,"description":1551,"date":1552,"slug":1553,"image":1554,"originalUrl":1555,"categories":1556},"\u002Fblog\u002Fapplicable-ai-for-businesses","Toepasbare AI voor bedrijven","Ontdek hoe ElioVP lokale AI voor bedrijfsprocessen bouwt, met modeltraining op maat en automatische schadedetectie voor de logistiek.","2025-07-09T21:35:30","applicable-ai-for-businesses","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fscherm_afbeelding-2025-07-09-om-23.30.17.webp","https:\u002F\u002Feliovp.com\u002Fapplicable-ai-for-businesses\u002F",[1331,1310,1429,1430,1530,1531,1532,1533,1435,1437,1362,1534,1535],{"path":1558,"title":1559,"description":1560,"date":1561,"slug":1562,"image":25,"originalUrl":1563,"categories":1564},"\u002Fblog\u002Fintroducing-paitons-free-evaluation-models","Maak kennis met de gratis evaluatiemodellen van Paiton","Test Paiton met gratis evaluatiemodellen voor AMD-GPU's. Vergelijk de prestaties voor tekst, beeldanalyse en beeldgeneratie met uw eigen workloads.","2025-07-07T11:26:13","introducing-paitons-free-evaluation-models","https:\u002F\u002Feliovp.com\u002Fintroducing-paitons-free-evaluation-models\u002F",[1331,1310,875],{"path":1566,"title":1567,"description":1568,"date":1569,"slug":1570,"image":1571,"originalUrl":1572,"categories":1573},"\u002Fblog\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","Llama 3.1 405B: sneller starten met Paiton op MI300X","Bekijk Paiton-benchmarks voor Llama 3.1 405B op acht AMD MI300X-GPU's, met opstarttijd, tensorparallelisme, throughput en latency.","2025-06-12T20:15:23","paiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fservingscreenshot.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b\u002F",[1331,1310,875,1378,1273,1485,1574,1487,1575,1576,1577,875,1578,1579],"Koude start","Grafiekcompilatie","Llama 3.1 405B","LLM-optimalisatie","Opstartlatentie","Tensor-parallellisme",{"path":1581,"title":1582,"description":1583,"date":1584,"slug":1585,"image":1586,"originalUrl":1587,"categories":1588},"\u002Fblog\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x","Paiton FP8 verslaat NVIDIA's H200 op AMD's MI300X","Vergelijk Paiton op AMD MI300X met NVIDIA H200 voor Llama 3.1 70B FP8: throughput, wachttijd tot het eerste token en latency bij diverse batchgroottes.","2025-06-08T19:12:40","paiton-fp8-beats-nvidias-h200-on-amds-mi300x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fblognewfp8.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x\u002F",[1331,1310,875,1378,1485,1589,1434,1354,1311,1312,1275,1576,1590,1591],"Koude startoptimalisatie","Model serving","vLLM-optimalisatie",{"path":1593,"title":1594,"description":1595,"date":1596,"slug":1597,"image":1598,"originalUrl":1599,"categories":1600},"\u002Fblog\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","MI300X, H200, RX 7900 XTX en n300s: vLLM-benchmarks","Vergelijk MI300X, H200, RX 7900 XTX en Tenstorrent n300s met vLLM: throughput, gemodelleerde tokenkosten en hardwarebeperkingen voor Llama 3 8B.","2025-05-09T14:03:58","mi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisontenstor.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm\u002F",[1331,1310,875,1429,1378,1347,1547,1359,1601,1602],"RX7900XTX","tenstorrent",{"path":1604,"title":1605,"description":1606,"date":1607,"slug":1608,"image":1609,"originalUrl":1610,"categories":1611},"\u002Fblog\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","ClusterP&L: financiële modellen voor GPU-clusters","Ontdek hoe ClusterP&L kosten, rendement en investeringsscenario's voor GPU-clusters modelleert, met risicoanalyses en exporteerbare rapporten.","2025-05-03T10:52:22","clusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisonscenarios.webp","https:\u002F\u002Feliovp.com\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights\u002F",[1331,1310,1377,1429,1348,1546,1612,1359,1613],"MI325X","P&L-calculator",{"path":1615,"title":1616,"description":1617,"date":1618,"slug":1619,"image":1620,"originalUrl":1621,"categories":1622},"\u002Fblog\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","AMD MI300X versus NVIDIA H200: Qwen3-32B met Paiton","Vergelijk Qwen3-32B-benchmarks op AMD MI300X met Paiton en NVIDIA H200, met resultaten voor throughput, latency en hardwarekosten.","2025-05-02T21:10:30","cranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002F3ac59a73-2466-4422-b7e5-ef2e4a8ca58e.webp","https:\u002F\u002Feliovp.com\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200\u002F",[1331,1310,875,1545,1347,1546,1623,1359,875,1250],"MI300",{"path":1625,"title":1626,"description":1627,"date":1628,"slug":1629,"image":1630,"originalUrl":1631,"categories":1632},"\u002Fblog\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","Modulaire datacenters voor NVIDIA NVL: 1 tot 2 MW","Ontdek modulaire datacenterontwerpen voor NVIDIA NVL-systemen, met aandacht voor vermogen, vloeistofkoeling, redundantie en uitrolplanning.","2025-05-02T14:09:59","power-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Feliovp_critical-1mw-pod_rev-2_transparent.webp","https:\u002F\u002Feliovp.com\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw\u002F",[1331,1377,1633,1448,1469,1335,1470,1471,1634,1635,1474,1636],"1-2MW datacenter","NVIDIA Blackwell","NVIDIA NVL","Precisiekoeling",{"path":1638,"title":1639,"description":1640,"date":1641,"slug":1642,"image":1643,"originalUrl":1644,"categories":1645},"\u002Fblog\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","AI-agents in de medische wereld: AI die DICOM spreekt","Ontdek een lokale AI-agent die DICOM-gegevens opzoekt en bekijk tests van beeldmodellen met geanonimiseerde medische beelden.","2025-04-11T14:45:48","examining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhealthcareblog-1.webp","https:\u002F\u002Feliovp.com\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom\u002F",[1331,1310,1429,1378,1545,1347,1646],"Zorg",{"path":1648,"title":1649,"description":1650,"date":1651,"slug":1652,"image":1653,"originalUrl":1654,"categories":1655},"\u002Fblog\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","Amerikaanse invoerheffingen en AI-leveringszekerheid in 2025","Lees ElioVP's visie uit april 2025 op Amerikaanse invoerheffingen en leveringszekerheid voor AI-servers, HPC-systemen en modulaire datacenters.","2025-04-04T10:01:27","eliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftariffsshipping.webp","https:\u002F\u002Feliovp.com\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs\u002F",[1331,1389,1545,1347,586,1656,1657,1658],"Taiwan","Invoerheffingen","Trump",{"path":1660,"title":1661,"description":1662,"date":1663,"slug":1664,"image":1665,"originalUrl":1666,"categories":1667},"\u002Fblog\u002Fwhy-ai-agents-are-the-future","Waarom AI-agenten de toekomst zijn","Ontdek AI-agents voor ERP, CRM, financiën en klantondersteuning, met praktijkvoorbeelden en een traject van procesanalyse tot pilot en uitrol.","2025-03-23T22:06:59","why-ai-agents-are-the-future","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ferp2.jpeg","https:\u002F\u002Feliovp.com\u002Fwhy-ai-agents-are-the-future\u002F",[1331,1310,1429,1545,1668,1669],"AI-agenten","ERP",{"path":1671,"title":1672,"description":1673,"date":1674,"slug":1675,"image":1676,"originalUrl":1677,"categories":1678},"\u002Fblog\u002Fthe-rise-of-open-source-ai-model-optimization","De opkomst van open-source AI-modeloptimalisatie","Verken trends in opensource-AI-optimalisatie: kwantisatie, mixture-of-experts-modellen, hardwaregerichte afstemming, RAG en edge-AI.","2025-03-22T20:59:23","the-rise-of-open-source-ai-model-optimization","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Friseofopensource.jpeg","https:\u002F\u002Feliovp.com\u002Fthe-rise-of-open-source-ai-model-optimization\u002F",[1331,1310,1389,1679,1347,546,1359],"AI-nieuws",{"path":1681,"title":1682,"description":1683,"date":1684,"slug":1685,"image":1686,"originalUrl":1687,"categories":1688},"\u002Fblog\u002Fintroducing-our-benchmarking-tool-powered-by-dstack","Maak kennis met onze benchmarktool, gebouwd op dstack","Ontdek onze benchmarktool met dstack: herhaalbare vLLM-tests, automatische parameterreeksen en prestatierapporten voor lokale GPU's en de cloud.","2025-03-20T14:21:59","introducing-our-benchmarking-tool-powered-by-dstack","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fbenchmarktool.jpeg","https:\u002F\u002Feliovp.com\u002Fintroducing-our-benchmarking-tool-powered-by-dstack\u002F",[1331,1310,875,1545,1347,1689,1690,1547,875],"benchmark","LLM",{"path":1692,"title":1693,"description":1694,"date":1695,"slug":1696,"image":1697,"originalUrl":1698,"categories":1699},"\u002Fblog\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","QwQ-32B optimaliseren (door Qwen): AMD MI300X versus NVIDIA H200","Vergelijk throughput en latency van QwQ-32B op AMD MI300X met Paiton en NVIDIA H200, bij kleine batches en meer gelijktijdige aanvragen.","2025-03-19T21:41:44","optimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton4.jpeg","https:\u002F\u002Feliovp.com\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200\u002F",[1331,1310,875],{"path":1701,"title":1702,"description":1703,"date":1704,"slug":1705,"image":1706,"originalUrl":1707,"categories":1708},"\u002Fblog\u002Feliovp-featured-on-amd-tech-talk-podcast","Eliovp te gast in de AMD Tech Talk-podcast","Beluister Elio Van Puyvelde en Jim Greene in de AMD Tech Talk-podcast over het ontstaan van ElioVP en de hardware- en softwarediensten voor AI.","2025-03-19T07:53:39","eliovp-featured-on-amd-tech-talk-podcast","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftechtalkjimgreene.jpeg","https:\u002F\u002Feliovp.com\u002Feliovp-featured-on-amd-tech-talk-podcast\u002F",[1331,1347,1709,1710,1711],"Jim Greene","Podcast","Tech Talk",{"path":1713,"title":1714,"description":1715,"date":1716,"slug":1717,"image":1718,"originalUrl":1719,"categories":1720},"\u002Fblog\u002Ffurther-optimizing-amd-powered-inference-with-paiton","AMD-inferentie verder optimaliseren met Paiton","Bekijk Paiton-benchmarks voor DeepSeek R1 Distill Llama 8B op AMD MI300X, gericht op throughput en latency bij kleinere batchgroottes.","2025-03-13T06:18:30","further-optimizing-amd-powered-inference-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost3.webp","https:\u002F\u002Feliovp.com\u002Ffurther-optimizing-amd-powered-inference-with-paiton\u002F",[1331,1310,875,1347,1721,1722,1546,1547,1612,875,1250],"DeepSeek","H100",{"path":1724,"title":1725,"description":1726,"date":1727,"slug":1728,"image":1729,"originalUrl":1730,"categories":1731},"\u002Fblog\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","Paiton-benchmarks: DeepSeek R1 Distill Llama 3.1 8B","Vergelijk standaard- en Paiton-versies van DeepSeek R1 Distill Llama 3.1 8B op AMD MI300X, met benchmarks voor throughput en latency.","2025-01-31T09:11:02","a-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost2.webp","https:\u002F\u002Feliovp.com\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b\u002F",[1331,1310,875,1347,1721,1722,1546,1547,1612,875,1250],{"path":1733,"title":1734,"description":1735,"date":1736,"slug":1737,"image":1738,"originalUrl":1739,"categories":1740},"\u002Fblog\u002Fai-model-optimization-with-paiton","AI-modeloptimalisatie met Paiton","Lees hoe Paiton modelcompilatie, aangepaste kernels en kernelfusie inzet om AI-inferentie op AMD GPU's te optimaliseren.","2025-01-30T19:53:25","ai-model-optimization-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost1.webp","https:\u002F\u002Feliovp.com\u002Fai-model-optimization-with-paiton\u002F",[1331,1310,875,1347,1722,1546,1547,1612,875,1250],1789853167825]