[{"data":1,"prerenderedAt":3139},["ShallowReactive",2],{"blog-post-nl-\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700":3,"blog-posts-sidebar-nl":2661},{"id":4,"title":5,"body":6,"categories":2642,"date":2648,"description":2649,"extension":2650,"heading":2651,"image":2652,"meta":2653,"navigation":707,"originalUrl":2654,"path":2655,"seo":2656,"slug":2657,"stem":2658,"updated":2659,"__hash__":2660},"blogNl\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700.md","Qwen3.8: 400,7 tok\u002Fs op één R9700 | Paiton",{"type":7,"value":8,"toc":2603},"minimark",[9,37,63,74,79,96,99,117,171,176,182,261,265,268,340,347,351,354,424,440,459,466,477,488,492,505,514,518,521,525,540,598,602,609,612,626,639,643,649,654,659,662,687,690,694,699,702,716,721,727,731,751,761,767,780,783,787,807,814,825,911,923,929,933,936,953,959,970,973,977,997,1003,1014,1027,1030,1035,1039,1052,1058,1069,1089,1095,1106,1109,1113,1126,1203,1214,1230,1241,1247,1258,1264,1268,1285,1305,1322,1325,1328,1332,1352,1365,1371,1382,1387,1391,1506,1515,1519,1527,1542,1600,1610,1630,1647,1651,1683,1693,1702,1706,1730,1734,1737,1747,1771,1775,1784,1791,1806,1817,1820,1845,1849,1885,1889,1896,1908,1921,1925,1934,1971,1977,1981,1984,1988,1991,1994,2008,2039,2047,2051,2071,2074,2092,2096,2102,2105,2108,2116,2120,2128,2148,2154,2158,2167,2170,2599],[10,11,12,16,17,20,21,24,25],"p",{},[13,14,15],"strong",{},"400,7 uitvoertokens per seconde in totaal op één Radeon AI PRO R9700."," De release van 18 september gebruikt ROCm 10 en vLLM 0.29.0, met een 65K-preset voor doorvoer en instelbare profielen voor lange gesprekken. De gewogen decodesnelheid is ",[13,18,19],{},"146,9 tok\u002Fs","; de categorie JSON haalt ",[13,22,23],{},"215,9 tok\u002Fs",".",[26,27,28],"sup",{},[29,30,36],"a",{"href":31,"ariaDescribedBy":32,"dataFootnoteRef":34,"id":35},"#user-content-fn-11",[33],"footnote-label","","user-content-fnref-11","1",[10,38,39,42,43,47,48,52,53,57,58,62],{},[13,40,41],{},"Bijgewerkt op 19 september 2026."," Bekijk de ",[29,44,46],{"href":45},"#actuele-release-4007-toks-op-%C3%A9%C3%A9n-r9700","actuele benchmark",", ",[29,49,51],{"href":50},"#lange-gesprekken-prefixcaching-die-je-kunt-proberen","200K\u002F220K-gesprekken met prefixcaching"," of de ",[29,54,56],{"href":55},"#start-de-rocm-10-release","actuele startinstructies",". De ",[29,59,61],{"href":60},"#oorspronkelijke-vergelijking-van-16-september","oorspronkelijke 57%-vergelijking"," en de experimenten van 17 september blijven hieronder bewaard als historische onderbouwing.",[10,64,65,68,69,73],{},[13,66,67],{},"Een nieuwe release, geen nieuw gecontroleerd winstpercentage."," Deze run gebruikt ",[70,71,72],"code",{},"unsloth\u002FQwen3.8-27B-NVFP4"," via het MXFP4-runtimepad, niet het eerdere AMD-checkpoint. Ook de runtime, sampling en workload zijn gewijzigd. We delen 400,7 daarom niet door een ouder resultaat om een gelijkwaardige snelheidswinst tegenover Radiance of de vorige Paiton-release te claimen.",[75,76,78],"h2",{"id":77},"actuele-release-4007-toks-op-één-r9700","Actuele release: 400,7 tok\u002Fs op één R9700",[10,80,81,82,85,86,89,90],{},"De cijfers komen uit ",[13,83,84],{},"één volledige validatierun met BetterBench 0.6.0: 290 geslaagde verzoeken inclusief opwarmruns",", op één R9700 met 32 GB en een ",[13,87,88],{},"vermogenslimiet van 300 W",". De preset met 65.536 tokens werd getest met thinking en APC uitgeschakeld. Sampling: temperatuur 0,7, top-p 0,95, top-k 20 en seed 42. Een vermogenslimiet is geen gemeten elektriciteitsverbruik.",[26,91,92],{},[29,93,36],{"href":31,"ariaDescribedBy":94,"dataFootnoteRef":34,"id":95},[33],"user-content-fnref-11-2",[97,98],"rocm-throughput-figure",{},[10,100,101],{},[102,103,104,105,111,112,116],"em",{},"65K-releasepreset; 48 verzoeken per gelijktijdigheidsniveau. Totale uitvoer gedeeld door verstreken tijd, niet de decodesnelheid per gebruiker. ",[29,106,110],{"href":107,"rel":108},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002F8f56157c05eb6a53f6cdab00a115e47b42fed2d1\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002FREADME.md#current-benchmark-results",[109],"nofollow","Gepubliceerde tabellen"," · ",[29,113,115],{"href":114},"\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002Fupdate-2026-09-19\u002Fresults.json","Grafiekgegevens",". De grafieklabels zijn Engels; de tabel hieronder is Nederlands.",[118,119,120,134],"table",{},[121,122,123],"thead",{},[124,125,126,130],"tr",{},[127,128,129],"th",{},"Gelijktijdige verzoeken",[127,131,133],{"align":132},"right","Totale uitvoer in tok\u002Fs",[135,136,137,145,153,161],"tbody",{},[124,138,139,142],{},[140,141,36],"td",{},[140,143,144],{"align":132},"115,0",[124,146,147,150],{},[140,148,149],{},"2",[140,151,152],{"align":132},"203,2",[124,154,155,158],{},[140,156,157],{},"4",[140,159,160],{"align":132},"296,5",[124,162,163,166],{},[140,164,165],{},"8",[140,167,168],{"align":132},[13,169,170],{},"400,7",[172,173,175],"h3",{"id":174},"decode-over-verschillende-taken","Decode over verschillende taken",[10,177,178,179,181],{},"De gewogen decodescore is ",[13,180,19],{},". Per categorie zijn er vijf beoordeelde runs na één opwarmrun. Het JSON-resultaat is een categoriescore, niet de algemene snelheid die elke gebruiker krijgt.",[118,183,184,194],{},[121,185,186],{},[124,187,188,191],{},[127,189,190],{},"Categorie",[127,192,193],{"align":132},"Mediane decode in tok\u002Fs",[135,195,196,204,212,220,230,238,246,254],{},[124,197,198,201],{},[140,199,200],{},"Chat",[140,202,203],{"align":132},"123,7",[124,205,206,209],{},[140,207,208],{},"Code",[140,210,211],{"align":132},"169,2",[124,213,214,217],{},[140,215,216],{},"Bestanden bewerken",[140,218,219],{"align":132},"185,0",[124,221,222,225],{},[140,223,224],{},"JSON",[140,226,227],{"align":132},[13,228,229],{},"215,9",[124,231,232,235],{},[140,233,234],{},"Wiskunde",[140,236,237],{"align":132},"182,7",[124,239,240,243],{},[140,241,242],{},"Proza",[140,244,245],{"align":132},"74,9",[124,247,248,251],{},[140,249,250],{},"Redeneren",[140,252,253],{"align":132},"112,5",[124,255,256,259],{},[140,257,258],{},"Samenvatten",[140,260,144],{"align":132},[172,262,264],{"id":263},"prefill-bij-langere-prompts","Prefill bij langere prompts",[10,266,267],{},"BetterBench deelt het werkelijke aantal prompttokens door de tijd tot het eerste token. Per diepte zijn er acht beoordeelde runs na twee opwarmruns. De gevraagde diepte is niet gelijk aan de werkelijk getokeniseerde invoer.",[118,269,270,283],{},[121,271,272],{},[124,273,274,277,280],{},[127,275,276],{},"Gevraagde diepte",[127,278,279],{"align":132},"Mediaan werkelijk aantal prompttokens",[127,281,282],{"align":132},"Mediane prefill in tok\u002Fs",[135,284,285,296,307,318,329],{},[124,286,287,290,293],{},[140,288,289],{},"2.000",[140,291,292],{"align":132},"1.516,5",[140,294,295],{"align":132},"3.503,6",[124,297,298,301,304],{},[140,299,300],{},"8.000",[140,302,303],{"align":132},"5.894,5",[140,305,306],{"align":132},"3.530,4",[124,308,309,312,315],{},[140,310,311],{},"16.000",[140,313,314],{"align":132},"11.802,0",[140,316,317],{"align":132},"3.536,9",[124,319,320,323,326],{},[140,321,322],{},"32.000",[140,324,325],{"align":132},"23.549,5",[140,327,328],{"align":132},"3.393,0",[124,330,331,334,337],{},[140,332,333],{},"64.000",[140,335,336],{"align":132},"47.016,5",[140,338,339],{"align":132},"3.113,0",[10,341,342,343,346],{},"Dit zijn metingen van de ",[13,344,345],{},"65K-configuratie",", niet van doorvoer bij 200K. “65K” betekent 65.536 contexttokens, hetzelfde aantal dat eerder “64K” werd genoemd. Alleen die naam betekent dus geen groter contextvenster.",[75,348,350],{"id":349},"lange-gesprekken-prefixcaching-die-je-kunt-proberen","Lange gesprekken: prefixcaching die je kunt proberen",[10,352,353],{},"Met de nieuwe publieke launchers is context een instelling bij het starten, geen vast ingebouwde imagelimiet. De context omvat de prompt, chat- en toolopmaak en gegenereerde uitvoer. VRAM en het ondersteunde modelbereik blijven beperkingen. Acht ingeplande verzoeken betekenen niet dat acht volledige 65K-gesprekken tegelijk passen.",[118,355,356,372],{},[121,357,358],{},[124,359,360,363,366,369],{},[127,361,362],{},"Actuele startkeuze",[127,364,365],{"align":132},"Totale context",[127,367,368],{"align":132},"Maximaal ingeplande verzoeken",[127,370,371],{},"APC",[135,373,374,387,399,412],{},[124,375,376,379,382,384],{},[140,377,378],{},"65K-releasepreset",[140,380,381],{"align":132},"65.536",[140,383,165],{"align":132},[140,385,386],{},"Uit",[124,388,389,392,395,397],{},[140,390,391],{},"200K-releasepreset",[140,393,394],{"align":132},"200.000",[140,396,36],{"align":132},[140,398,386],{},[124,400,401,404,407,409],{},[140,402,403],{},"Chatprofiel",[140,405,406],{"align":132},"200.000; override getest tot 220.000",[140,408,36],{"align":132},[140,410,411],{},"Aan, experimentele configuratie",[124,413,414,417,420,422],{},[140,415,416],{},"Desktopprofiel",[140,418,419],{"align":132},"32.768",[140,421,36],{"align":132},[140,423,386],{},[10,425,426,429,430,433,434],{},[13,427,428],{},"Het chatprofiel is nu publiek uitvoerbaar."," Het hergebruikt ongewijzigde gespreksgeschiedenis met prefixcaching, een ",[13,431,432],{},"KV-pool van 8 GiB",", prefill-chunks van 1.024 tokens en thinking uitgeschakeld. Gebruik een dedicated R9700: er blijft weinig VRAM over. Dit is een andere configuratie dan de doorvoerbenchmark; APC staat niet standaard aan in de releasepresets.",[26,435,436],{},[29,437,36],{"href":31,"ariaDescribedBy":438,"dataFootnoteRef":34,"id":439},[33],"user-content-fnref-11-3",[10,441,442,443,446,447,450,451,454,455,458],{},"In één retrievaltest met een contextinstelling van 220K werd een ",[13,444,445],{},"prompt van 215.005 tokens"," afgehandeld in ",[13,448,449],{},"130,00 seconden zonder cache en 1,77 seconden bij een identieke herhaling",", met hergebruik van ",[13,452,453],{},"213.840 gecachete tokens",". Beide antwoorden telden negen tokens bij temperatuur nul. Dit zijn ",[13,456,457],{},"volledige responstijden uit één functionele test",", geen TTFT, algemene latentiegarantie of snellere decode. Ook retrieval met een gewijzigde prefix, twee langere antwoorden, een volgende XML-toolaanroep en een nieuw kort verzoek slaagden. Dit is geen brede kwaliteitsvalidatie voor lange gesprekken.",[10,460,461,462,465],{},"Een afzonderlijke test van de 200K-image slaagde met 198.989 prompttokens gevolgd door generatie en gewone en gestreamde XML-toolaanroepen. De grootste geteste contextinstelling is ",[13,463,464],{},"220.000",", niet de architecturale modelgrens van 262.144 tokens.",[10,467,468,469,472,473,476],{},"Cachehits vereisen een ongewijzigde prefix die nog in het geheugen aanwezig is. Ze besparen herhaald promptwerk, niet het genereren van elk nieuw token. Opstartcaches op schijf staan hier los van. Het chatprofiel rapporteert ",[70,470,471],{},"usage.prompt_tokens_details.cached_tokens","; streamingclients hebben ook ",[70,474,475],{},"\"stream_options\":{\"include_usage\":true}"," nodig.",[10,478,479,480,483,484,487],{},"Voor een GPU die ook desktopapplicaties draait, begint ",[70,481,482],{},"--profile desktop"," kleiner: 2 GiB cache en één ingepland verzoek. Dat garandeert niet dat het geheugen altijd volstaat. Alleen de context verlagen verkleint geen vaste KV-toewijzing. Deze launchers zijn ",[13,485,486],{},"alleen voor tekst",". De afzonderlijke beeldtest is geen vrijgegeven multimodaal 200K\u002F220K-profiel.",[75,489,491],{"id":490},"start-de-rocm-10-release","Start de ROCm 10-release",[10,493,494,495,500,501,504],{},"Gebruik Linux x86-64, Python 3, Docker, de Hugging Face CLI en één Radeon AI PRO R9700 met 32 GB en werkende AMD-GPU-toegang. Haal de ",[29,496,499],{"href":497,"rel":498},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002F8f56157c05eb6a53f6cdab00a115e47b42fed2d1\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002FREADME.md#run-the-current-release",[109],"publieke repository"," op en voer de opdrachten uit vanuit de hoofdmap. Voor reproduceerbaarheid volgt dit artikel commit ",[70,502,503],{},"8f56157c05eb6a53f6cdab00a115e47b42fed2d1",". De launchers leggen de images vast via een onveranderlijke digest. Gebruik voor deze release niet het oude AMD-checkpoint of de historische automatische downloader.",[10,506,507,508,513],{},"Selecteer de GPU via de gedocumenteerde ROCm-zichtbaarheidsvariabelen. Die worden ongewijzigd doorgegeven; controleer bestaande maskers in plaats van indices blind te combineren. Zie de ",[29,509,512],{"href":510,"rel":511},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002F8f56157c05eb6a53f6cdab00a115e47b42fed2d1\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002FREADME.md#gpu-context-and-memory-controls",[109],"GPU- en geheugeninstellingen",". Draai slechts één profiel tegelijk op de kaart.",[172,515,517],{"id":516},"start-het-200k-chatprofiel","Start het 200K-chatprofiel",[10,519,520],{},"Deze opdrachten downloaden de exacte snapshots van doel- en draftmodel en starten de server op de voorgrond. De eerste image-download is ongeveer 9,6 GB, exclusief gewichten. Bij het starten worden gewichten geladen\u002Fgeconverteerd en runtimecomponenten gecompileerd. Wacht tot de server klaar is voordat je prestaties meet. Volgende starts hergebruiken de blijvende cache; een private compilercheckout is niet nodig.",[522,523],"qwen-launch",{"profile":524},"rocm10-chat",[10,526,527,528,533,534,539],{},"De API gebruikt ",[13,529,530],{},[70,531,532],{},"http:\u002F\u002F127.0.0.1:18982\u002Fv1"," en modelnaam ",[13,535,536],{},[70,537,538],{},"Qwen3.8",", niet de historische poort en modelnaam verderop:",[541,542,546],"pre",{"className":543,"code":544,"language":545,"meta":34,"style":34},"language-bash shiki shiki-themes github-light github-dark","curl --fail http:\u002F\u002F127.0.0.1:18982\u002Fhealth\ncurl --fail http:\u002F\u002F127.0.0.1:18982\u002Fv1\u002Fchat\u002Fcompletions \\\n  -H 'Content-Type: application\u002Fjson' \\\n  -d '{\"model\":\"Qwen3.8\",\"messages\":[{\"role\":\"user\",\"content\":\"Write a Python function that removes duplicate items while preserving order.\"}],\"temperature\":0.7,\"top_p\":0.95,\"max_tokens\":256,\"stream\":true,\"chat_template_kwargs\":{\"enable_thinking\":false}}'\n","bash",[70,547,548,565,578,589],{"__ignoreMap":34},[549,550,553,557,561],"span",{"class":551,"line":552},"line",1,[549,554,556],{"class":555},"sScJk","curl",[549,558,560],{"class":559},"sj4cs"," --fail",[549,562,564],{"class":563},"sZZnC"," http:\u002F\u002F127.0.0.1:18982\u002Fhealth\n",[549,566,568,570,572,575],{"class":551,"line":567},2,[549,569,556],{"class":555},[549,571,560],{"class":559},[549,573,574],{"class":563}," http:\u002F\u002F127.0.0.1:18982\u002Fv1\u002Fchat\u002Fcompletions",[549,576,577],{"class":559}," \\\n",[549,579,581,584,587],{"class":551,"line":580},3,[549,582,583],{"class":559},"  -H",[549,585,586],{"class":563}," 'Content-Type: application\u002Fjson'",[549,588,577],{"class":559},[549,590,592,595],{"class":551,"line":591},4,[549,593,594],{"class":559},"  -d",[549,596,597],{"class":563}," '{\"model\":\"Qwen3.8\",\"messages\":[{\"role\":\"user\",\"content\":\"Write a Python function that removes duplicate items while preserving order.\"}],\"temperature\":0.7,\"top_p\":0.95,\"max_tokens\":256,\"stream\":true,\"chat_template_kwargs\":{\"enable_thinking\":false}}'\n",[172,599,601],{"id":600},"kies-de-65k-benchmarkpreset","Kies de 65K-benchmarkpreset",[10,603,604,605,608],{},"Stop eerst de andere server met ",[70,606,607],{},"docker stop paiton-qwen38-200k",". Behoud dezelfde modelmappen en gebruik:",[522,610],{"profile":611},"rocm10-65k",[10,613,614,617,618,621,622,625],{},[13,615,616],{},"Stel thinking expliciet in om de benchmark te volgen."," De modeltemplate van de releasepreset schakelt thinking in wanneer de client niets opgeeft. Het chatprofiel en de benchmarks schakelen het uit. Gebruik ",[70,619,620],{},"--thinking off"," als serverstandaard of ",[70,623,624],{},"\"chat_template_kwargs\":{\"enable_thinking\":false}"," per verzoek.",[10,627,628,629,632,633,638],{},"Voor 220K-gesprekken stop je de draaiende server en gebruik je ",[70,630,631],{},"bash models\u002FQwen3.8-MXFP4-DFlash2\u002Frun-rocm10-200k.sh --profile chat --context 220000",". Gebruik het volledige chatprofiel; ga er niet van uit dat alleen APC inschakelen de geheugenvereisten onveranderd laat. De ",[29,634,637],{"href":635,"rel":636},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002F8f56157c05eb6a53f6cdab00a115e47b42fed2d1\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002FREADME.md#200k-and-220k-with-prefix-caching",[109],"publieke handleiding"," beschrijft de geteste instellingen en beperkingen.",[75,640,642],{"id":641},"oorspronkelijke-vergelijking-van-16-september","Oorspronkelijke vergelijking van 16 september",[10,644,645,648],{},[13,646,647],{},"Historische scope:"," de vergelijking hieronder gebruikt het eerdere AMD-checkpoint, vLLM 0.28 en de gelijk opgezette 8K-configuratie. De winst van 57% blijft geldig voor die tests, maar is geen procentuele claim voor de ROCm 10-release.",[10,650,651],{},[13,652,653],{},"Eén Radeon AI PRO R9700. Hetzelfde Qwen3.8-27B MXFP4-checkpoint. Dezelfde 5 GiB voor de cache. Paiton levert 57% meer totale doorvoer dan onze vergelijkbare Radiance + DFlash2-referentie bij acht gelijktijdige verzoeken. De mediane tijd tot het eerste token daalt van 6,59 seconden naar 195 milliseconden.",[10,655,656],{},[102,657,658],{},"De kerncijfers voor doorvoer en responstijd komen uit de oorspronkelijke, gelijk opgezette vergelijking met 188 verzoeken, bij acht gelijktijdige verzoeken en een contextlimiet van 8.192 tokens. Beide versnelde engines gebruiken dezelfde snapshots van het doelmodel en het DFlash2-draftmodel. De GPU-afbeelding is illustratief.",[10,660,661],{},"Dit is een flinke stap vooruit voor het aanbieden van een 27B-model op één workstation-GPU. Het gaat niet alleen om snellere generatie voor één gebruiker: er kunnen meer verzoeken tegelijk vooruitgang boeken, de geschatte cachecapaciteit is bijna drie keer zo groot en de wachttijd onder belasting is veel korter.",[10,663,664,665,668,669,672,673,676,677,680],{},"Paiton haalt ",[13,666,667],{},"314,5 uitvoertokens per seconde in totaal",", tegenover ",[13,670,671],{},"200,3 tok\u002Fs"," voor de vergelijkbare versnelde referentie. De gewogen seriële decodesnelheid stijgt met ",[13,674,675],{},"22%"," en prefill is sneller bij elke geteste promptlengte. De uitvoering loopt via een plugin op de officiële vLLM 0.28 ROCm-runtime. ",[13,678,679],{},"De geïnstalleerde vLLM-bibliotheek blijft ongewijzigd.",[26,681,682],{},[29,683,149],{"href":684,"ariaDescribedBy":685,"dataFootnoteRef":34,"id":686},"#user-content-fn-bench",[33],"user-content-fnref-bench",[10,688,689],{},"Het waardevolle zit in die combinatie: duidelijk betere lokale prestaties, met behoud van de reguliere vLLM-deployment.",[75,691,693],{"id":692},"bekijk-het-in-actie","Bekijk het in actie",[10,695,696],{},[102,697,698],{},"Historische opname van de oorspronkelijke release, geen demonstratie van de nieuwe ROCm 10-benchmark of het 220K-chatprofiel.",[10,700,701],{},"Bekijk hoe Qwen3.8 antwoorden genereert op één Radeon AI PRO R9700, met Paiton + DFlash2 via regulier vLLM. De opname toont de gestreamde uitvoer, live generatiecijfers en GPU-activiteit.",[10,703,704],{},[705,706],"video",{"controls":707,"playsInline":707,"preload":708,"width":709,"height":710,"ariaLabel":711,"ariaDescribedBy":712,"poster":714,"src":715},true,"none",1354,1080,"Schermopname van Qwen3.8 dat antwoorden genereert met Paiton op één Radeon AI PRO R9700",[713],"paiton-live-demo-caption","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002Flive-demo-poster.webp","\u002Fasset\u002Fvideos\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002Fpaiton-qwen38-r9700-demo.mp4",[10,717,718],{"id":713},[102,719,720],{},"Schermopname van 70 seconden met telkens één actief verzoek. De live cijfers gelden voor de getoonde verzoeken, niet voor de totale doorvoer bij acht gelijktijdige verzoeken in de benchmark hieronder.",[10,722,723,726],{},[29,724,725],{"href":715},"Open de opname (MP4, 10,2 MB)",". Gebruik de knop voor volledig scherm om alles van dichtbij te bekijken.",[75,728,730],{"id":729},"een-sterke-referentie-een-beter-resultaat","Een sterke referentie. Een beter resultaat.",[10,732,733,734,739,740,24,743],{},"Het onderzoek begon met het indrukwekkende werk rond ",[29,735,738],{"href":736,"rel":737},"https:\u002F\u002Fgithub.com\u002Fmagiccodingman\u002Fvllm-radiance",[109],"vLLM-Radiance",". De resultaten op AMD-hardware brachten ons op ideeën en moedigden ons aan onze eigen R9700-implementatie verder te optimaliseren. De publieke documentatie beschrijft ondersteuning voor hetzelfde AMD Quark MXFP4-model en DFlash2-versnelling. De gepubliceerde prestatiecijfers van dat project gebruiken ",[13,741,742],{},"twee R9700's",[26,744,745],{},[29,746,750],{"href":747,"ariaDescribedBy":748,"dataFootnoteRef":34,"id":749},"#user-content-fn-radiance",[33],"user-content-fnref-radiance","3",[10,752,753],{},[13,754,755,756,24],{},"Radiance inspireerde dit onderzoek. Paitons native HIP-integratie bevat aangepaste technieken uit Radiance en libr4d, met bronvermelding in de ",[29,757,760],{"href":758,"rel":759},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002FTHIRD_PARTY_NOTICES.md",[109],"publieke vermeldingen van derden",[10,762,763,764],{},"Onze vraag was: ",[13,765,766],{},"hoeveel kunnen we met dit model uit één kaart halen, met behoud van de reguliere vLLM-deployment?",[10,768,769,770,773,774],{},"Daarom hebben we Radiance + DFlash2 en Paiton op vLLM + DFlash2 zelf op ",[13,771,772],{},"één R9700"," getest. Beide gebruikten hetzelfde checkpoint, dezelfde snapshots van doel- en draftmodel, een FP8-KV-cache, een cachetoewijzing van 5 GiB en een contextlimiet van 8.192 tokens. De twee versnelde profielen gebruikten zeven speculatieve tokens, greedy sampling en uitgeschakelde prefixcaching.",[26,775,776],{},[29,777,149],{"href":684,"ariaDescribedBy":778,"dataFootnoteRef":34,"id":779},[33],"user-content-fnref-bench-2",[10,781,782],{},"Onze winstpercentages vergelijken die gelijk opgezette tests op één GPU. We vergelijken dus geen resultaat op één kaart met een extern gepubliceerd resultaat op twee kaarten.",[75,784,786],{"id":785},"_57-meer-doorvoer-met-een-grotere-voorsprong-onder-belasting","57% meer doorvoer, met een grotere voorsprong onder belasting",[10,788,789,790,793,794,800],{},"Het hoofdresultaat komt uit de ",[13,791,792],{},"volledige BetterBench-preset met 188 verzoeken",", niet uit de kortere vergelijking met maximaal 128 uitvoertokens. We behielden de oorspronkelijke, ruimere uitvoerbudgetten van de preset, met tien gemeten herhalingen per taakcategorie, 24 verzoeken per getest gelijktijdigheidsniveau en herhaalde prefill-metingen. Beide engines voltooiden alle verzoeken.",[26,795,796],{},[29,797,149],{"href":684,"ariaDescribedBy":798,"dataFootnoteRef":34,"id":799},[33],"user-content-fnref-bench-3",[26,801,802],{},[29,803,157],{"href":804,"ariaDescribedBy":805,"dataFootnoteRef":34,"id":806},"#user-content-fn-betterbench",[33],"user-content-fnref-betterbench",[10,808,809],{},[810,811],"img",{"alt":812,"src":813},"Paiton haalt bij acht gelijktijdige verzoeken 314,5 uitvoertokens per seconde in totaal, tegenover 200,3 voor Radiance, en loopt voor bij elk getest gelijktijdigheidsniveau.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002F01-full-throughput.webp",[10,815,816,819],{},[102,817,818],{},"Volledige workload met 188 verzoeken, runs 495 \u002F 494. De totale doorvoer omvat prefill en wachtrijtijd. Hoger is beter.",[26,820,821],{},[29,822,149],{"href":684,"ariaDescribedBy":823,"dataFootnoteRef":34,"id":824},[33],"user-content-fnref-bench-4",[118,826,827,842],{},[121,828,829],{},[124,830,831,833,836,839],{},[127,832,129],{},[127,834,835],{"align":132},"Radiance + DFlash2",[127,837,838],{"align":132},"Paiton op vLLM + DFlash2",[127,840,841],{"align":132},"Winst met Paiton",[135,843,844,861,878,895],{},[124,845,846,848,851,856],{},[140,847,36],{},[140,849,850],{"align":132},"76,9 tok\u002Fs",[140,852,853],{"align":132},[13,854,855],{},"89,6 tok\u002Fs",[140,857,858],{"align":132},[13,859,860],{},"16,5%",[124,862,863,865,868,873],{},[140,864,149],{},[140,866,867],{"align":132},"142,7 tok\u002Fs",[140,869,870],{"align":132},[13,871,872],{},"165,7 tok\u002Fs",[140,874,875],{"align":132},[13,876,877],{},"16,1%",[124,879,880,882,885,890],{},[140,881,157],{},[140,883,884],{"align":132},"187,1 tok\u002Fs",[140,886,887],{"align":132},[13,888,889],{},"254,8 tok\u002Fs",[140,891,892],{"align":132},[13,893,894],{},"36,2%",[124,896,897,899,901,906],{},[140,898,165],{},[140,900,671],{"align":132},[140,902,903],{"align":132},[13,904,905],{},"314,5 tok\u002Fs",[140,907,908],{"align":132},[13,909,910],{},"57,0%",[10,912,913,916,917],{},[13,914,915],{},"Paiton loopt voor bij elk getest gelijktijdigheidsniveau."," Ook de resultaten per taakcategorie laten een voorsprong zien voor code, redeneren, proza, JSON, bestandsbewerking, samenvatten, wiskunde en chat. De winst houdt dus stand in de langere workload en hangt niet af van één gunstige prompt.",[26,918,919],{},[29,920,149],{"href":684,"ariaDescribedBy":921,"dataFootnoteRef":34,"id":922},[33],"user-content-fnref-bench-5",[10,924,925,926],{},"Dit zijn totale verwerkingssnelheden voor de actieve workload. ",[13,927,928],{},"314,5 tok\u002Fs betekent niet dat elk van de acht gebruikers 314,5 tok\u002Fs ontvangt.",[75,930,932],{"id":931},"van-659-seconden-wachten-naar-een-eerste-token-in-195-milliseconden","Van 6,59 seconden wachten naar een eerste token in 195 milliseconden",[10,934,935],{},"De winst in doorvoer is groot. De verbetering in responsiviteit onder belasting is nog groter.",[10,937,938,939,942,943,946,947],{},"Bij vier gelijktijdige verzoeken daalt de mediane tijd tot het eerste token van ",[13,940,941],{},"1.627 ms naar 180 ms",". Bij acht daalt die van ",[13,944,945],{},"6.586 ms naar 195 ms: 97% korter",". Deze tijden zijn inclusief wachtrijtijd en beschrijven dus hoe lang de client wacht voordat het antwoord begint.",[26,948,949],{},[29,950,149],{"href":684,"ariaDescribedBy":951,"dataFootnoteRef":34,"id":952},[33],"user-content-fnref-bench-6",[10,954,955],{},[810,956],{"alt":957,"src":958},"Bij acht gelijktijdige verzoeken daalt de mediane tijd tot het eerste token van 6.586 milliseconden met Radiance naar 195 milliseconden met Paiton.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002F02-time-to-first-token.webp",[10,960,961,964],{},[102,962,963],{},"Volledige workload met 188 verzoeken. Lager is beter. Bij één en twee gelijktijdige verzoeken behoudt Radiance een TTFT-voordeel van 10 tot 11 ms. Paiton levert bij beide niveaus wel meer doorvoer.",[26,965,966],{},[29,967,149],{"href":684,"ariaDescribedBy":968,"dataFootnoteRef":34,"id":969},[33],"user-content-fnref-bench-7",[10,971,972],{},"Voor een gedeelde programmeerassistent of een lokaal endpoint voor agents is doorvoer alleen niet genoeg. Een endpoint dat meer tokens produceert maar verzoeken lang laat wachten voordat de generatie begint, kan nog steeds traag aanvoelen. Hier gaat de hogere doorvoer bij meer gelijktijdige verzoeken samen met een veel kortere wachttijd tot het eerste token.",[75,974,976],{"id":975},"dezelfde-5-gib-biedt-bijna-drie-keer-de-tokencapaciteit","Dezelfde 5 GiB biedt bijna drie keer de tokencapaciteit",[10,978,979,980,983,984,987,988,24,991],{},"Met ",[13,981,982],{},"precies 5 GiB gereserveerd per engine"," rapporteren de runtimes ",[13,985,986],{},"25.746 cachetokenslots voor Radiance en 74.430 voor Paiton",". Dat is ",[13,989,990],{},"2,89× de geschatte tokencapaciteit binnen dezelfde geheugentoewijzing",[26,992,993],{},[29,994,149],{"href":684,"ariaDescribedBy":995,"dataFootnoteRef":34,"id":996},[33],"user-content-fnref-bench-8",[10,998,999],{},[810,1000],{"alt":1001,"src":1002},"Binnen een cachetoewijzing van 5 GiB rapporteert Radiance 25.746 tokenslots en Paiton 74.430: 2,89 keer de geschatte capaciteit.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002F03-cache-capacity.webp",[10,1004,1005,1008],{},[102,1006,1007],{},"Door de runtime gerapporteerde schattingen van de gedeelde cachecapaciteit, geen fysieke VRAM-capaciteit. In de oorspronkelijke benchmarkconfiguratie was de contextlimiet per verzoek 8.192 tokens.",[26,1009,1010],{},[29,1011,149],{"href":684,"ariaDescribedBy":1012,"dataFootnoteRef":34,"id":1013},[33],"user-content-fnref-bench-9",[10,1015,1016,1017,1020,1021],{},"De logs van deze tests tonen maximaal ",[13,1018,1019],{},"drie actieve verzoeken voor Radiance en acht voor Paiton"," binnen de vergelijkbare configuratie. Dat zijn waarnemingen uit deze runs, geen algemene limieten voor het aantal gelijktijdige verzoeken van beide engines.",[26,1022,1023],{},[29,1024,149],{"href":684,"ariaDescribedBy":1025,"dataFootnoteRef":34,"id":1026},[33],"user-content-fnref-bench-10",[10,1028,1029],{},"Die extra capaciteit helpt de betere ervaring bij gelijktijdig gebruik te verklaren: meer verzoeken kunnen binnen hetzelfde geheugenbudget vooruitgang boeken. De capaciteitscijfers en het waargenomen aantal actieve verzoeken passen bij de gemeten doorvoer en responstijd. Ze bewijzen niet dat alleen het cachebeheer de verbetering veroorzaakt.",[10,1031,1032],{},[13,1033,1034],{},"Meer bruikbare capaciteit voor verzoeken, niet meer VRAM of een groter contextvenster.",[75,1036,1038],{"id":1037},"snellere-decode-en-prefill-over-de-hele-workload","Snellere decode en prefill, over de hele workload",[10,1040,1041,1042,1045,1046],{},"De winst beperkt zich niet tot het tegelijk toelaten van meer verzoeken. In de volledige workload stijgt de gewogen seriële decodesnelheid van ",[13,1043,1044],{},"86,0 naar 104,9 uitvoertokens per seconde: 22% hoger",". Dit meet de generatie na het eerste token en staat los van de totale doorvoer voor de volledige workload hierboven.",[26,1047,1048],{},[29,1049,149],{"href":684,"ariaDescribedBy":1050,"dataFootnoteRef":34,"id":1051},[33],"user-content-fnref-bench-11",[10,1053,1054],{},[810,1055],{"alt":1056,"src":1057},"De gewogen seriële decodesnelheid voor de volledige workload stijgt van 86,0 naar 104,9 uitvoertokens per seconde, een toename van 22 procent.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002F04-serial-decode.webp",[10,1059,1060,1063],{},[102,1061,1062],{},"Gewogen seriële decodesnelheid voor de volledige workload. Dezelfde snapshots van doel- en draftmodel op dezelfde R9700.",[26,1064,1065],{},[29,1066,149],{"href":684,"ariaDescribedBy":1067,"dataFootnoteRef":34,"id":1068},[33],"user-content-fnref-bench-12",[10,1070,1071,1072,1075,1076,1079,1080,24,1083],{},"Ook prefill verbetert bij elke geteste promptlengte. Bij ongeveer ",[13,1073,1074],{},"1.556 \u002F 3.024 \u002F 5.226 invoertokens"," haalt Radiance ",[13,1077,1078],{},"2.828 \u002F 3.003 \u002F 2.926 invoertokens per seconde",". Paiton haalt ",[13,1081,1082],{},"3.182 \u002F 3.521 \u002F 3.367 invoertokens per seconde",[26,1084,1085],{},[29,1086,149],{"href":684,"ariaDescribedBy":1087,"dataFootnoteRef":34,"id":1088},[33],"user-content-fnref-bench-13",[10,1090,1091],{},[810,1092],{"alt":1093,"src":1094},"Paiton verwerkt 3.182, 3.521 en 3.367 invoertokens per seconde bij drie promptlengtes en is bij elke lengte sneller dan Radiance.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002F05-full-prefill.webp",[10,1096,1097,1100],{},[102,1098,1099],{},"Prefill voor de volledige workload: 12,5%, 17,2% en 15,1% hoger, berekend op basis van de getoonde samenvattingswaarden. Dit is het werkelijke aantal prompttokens gedeeld door de HTTP-tijd tot het eerste token, geen geïsoleerde kerneldoorvoer.",[26,1101,1102],{},[29,1103,149],{"href":684,"ariaDescribedBy":1104,"dataFootnoteRef":34,"id":1105},[33],"user-content-fnref-bench-14",[10,1107,1108],{},"Samen laten deze resultaten verbetering zien op meerdere momenten die een gebruiker merkt: de prompt verwerken, onder belasting aan het antwoord beginnen en de rest van het antwoord genereren.",[75,1110,1112],{"id":1111},"het-verschil-met-standaard-vllm-is-groot","Het verschil met standaard-vLLM is groot",[10,1114,1115,1116,1119,1120],{},"Daarnaast testten we een afzonderlijke ",[13,1117,1118],{},"matrix met 54 verzoeken en maximaal 128 uitvoertokens",". Daarin vergeleken we standaard-vLLM O2, Radiance + DFlash2 en Paiton op vLLM + DFlash2. Voor standaard-vLLM gebruikten we de beste O2-instellingen die we hadden getest.",[26,1121,1122],{},[29,1123,149],{"href":684,"ariaDescribedBy":1124,"dataFootnoteRef":34,"id":1125},[33],"user-content-fnref-bench-15",[118,1127,1128,1141],{},[121,1129,1130],{},[124,1131,1132,1134,1137,1139],{},[127,1133,129],{},[127,1135,1136],{"align":132},"Standaard-vLLM O2",[127,1138,835],{"align":132},[127,1140,838],{"align":132},[135,1142,1143,1158,1173,1188],{},[124,1144,1145,1147,1150,1153],{},[140,1146,36],{},[140,1148,1149],{"align":132},"4,5 tok\u002Fs",[140,1151,1152],{"align":132},"78,0 tok\u002Fs",[140,1154,1155],{"align":132},[13,1156,1157],{},"90,0 tok\u002Fs",[124,1159,1160,1162,1165,1168],{},[140,1161,149],{},[140,1163,1164],{"align":132},"8,8 tok\u002Fs",[140,1166,1167],{"align":132},"151,2 tok\u002Fs",[140,1169,1170],{"align":132},[13,1171,1172],{},"160,5 tok\u002Fs",[124,1174,1175,1177,1180,1183],{},[140,1176,157],{},[140,1178,1179],{"align":132},"17,4 tok\u002Fs",[140,1181,1182],{"align":132},"189,2 tok\u002Fs",[140,1184,1185],{"align":132},[13,1186,1187],{},"231,5 tok\u002Fs",[124,1189,1190,1192,1195,1198],{},[140,1191,165],{},[140,1193,1194],{"align":132},"33,7 tok\u002Fs",[140,1196,1197],{"align":132},"175,6 tok\u002Fs",[140,1199,1200],{"align":132},[13,1201,1202],{},"328,5 tok\u002Fs",[10,1204,1205,1208],{},[102,1206,1207],{},"Totale uitvoerdoorvoer in de afzonderlijke matrix met 54 verzoeken en een uitvoerlimiet van 128 tokens, runs 403 \u002F 493 \u002F 492. Waarden uit de gepubliceerde benchmarksamenvatting. Deze vergelijking is niet de bron van het hoofdresultaat van 57%.",[26,1209,1210],{},[29,1211,149],{"href":684,"ariaDescribedBy":1212,"dataFootnoteRef":34,"id":1213},[33],"user-content-fnref-bench-16",[10,1215,1216,1217,1220,1221,24,1224],{},"Bij acht gelijktijdige verzoeken stijgt de totale doorvoer van ",[13,1218,1219],{},"33,7 tok\u002Fs met standaard-vLLM naar 328,5 tok\u002Fs met Paiton",", bijna een vertienvoudiging. De gewogen seriële decodesnelheid in deze kortere vergelijking stijgt van ",[13,1222,1223],{},"4,5 naar 113,5 tok\u002Fs",[26,1225,1226],{},[29,1227,149],{"href":684,"ariaDescribedBy":1228,"dataFootnoteRef":34,"id":1229},[33],"user-content-fnref-bench-17",[10,1231,1232,1233,1236,1237,1240],{},"De reikwijdte van die vergelijking is belangrijk. Standaard-vLLM gebruikt ",[13,1234,1235],{},"W4A4-emulatie volgens het checkpoint",", terwijl de versnelde configuraties ",[13,1238,1239],{},"W4A8-uitvoering met DFlash2"," gebruiken. Dit zijn volledige engineconfiguraties met dezelfde gewichten, niet identieke berekeningen voor activaties. De cijfers betekenen ook niet dat het vervangen van één kernel de volledige winst oplevert, of dat dit resultaat geldt voor elk model of elke kwantisatie op standaard-vLLM.",[10,1242,1243],{},[810,1244],{"alt":1245,"src":1246},"In de afzonderlijke prefill-vergelijking met 54 verzoeken is Paiton sneller dan standaard-vLLM O2 en Radiance bij alle drie de geteste promptlengtes.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002F07-three-engine-prefill.webp",[10,1248,1249,1252],{},[102,1250,1251],{},"Prefill in de afzonderlijke matrix met beperkte uitvoerlengte, op basis van de werkelijke getokeniseerde promptlengtes. Deze waarden horen niet bij de prefill-reeks voor de volledige workload hierboven.",[26,1253,1254],{},[29,1255,149],{"href":684,"ariaDescribedBy":1256,"dataFootnoteRef":34,"id":1257},[33],"user-content-fnref-bench-18",[10,1259,1260,1261],{},"Daarom baseren we het hoofdresultaat op de zwaardere vergelijking: ",[13,1262,1263],{},"Paiton tegenover een al versnelde Radiance + DFlash2-referentie, bevestigd in de langere workload.",[75,1265,1267],{"id":1266},"regulier-vllm-de-geïnstalleerde-bibliotheek-blijft-intact","Regulier vLLM. De geïnstalleerde bibliotheek blijft intact.",[10,1269,1270,1271,1277],{},"Die deploymentvorm is een bewuste keuze. Paiton integreert via de uitbreidingsmechanismen van vLLM en levert native HIP-runtimebestanden voor de geoptimaliseerde uitvoering. Het pluginsysteem van vLLM is bedoeld om uitbreidingen mogelijk te maken zonder de codebase aan te passen.",[26,1272,1273],{},[29,1274,149],{"href":684,"ariaDescribedBy":1275,"dataFootnoteRef":34,"id":1276},[33],"user-content-fnref-bench-19",[26,1278,1279],{},[29,1280,1284],{"href":1281,"ariaDescribedBy":1282,"dataFootnoteRef":34,"id":1283},"#user-content-fn-plugins",[33],"user-content-fnref-plugins","5",[10,1286,1287,1288,1291,1297],{},"De geoptimaliseerde uitvoering gebruikt Paitons native HIP-kernels en DFlash2-integratie. De release bundelt de benodigde runtimebestanden voor de geteste deployment, inclusief de DFlash2-integratie, zodat gebruikers geen apart DFlash-pakket hoeven te installeren. ",[13,1289,1290],{},"Onze Paiton-compiler blijft gesloten.",[26,1292,1293],{},[29,1294,149],{"href":684,"ariaDescribedBy":1295,"dataFootnoteRef":34,"id":1296},[33],"user-content-fnref-bench-20",[26,1298,1299],{},[29,1300,1304],{"href":1301,"ariaDescribedBy":1302,"dataFootnoteRef":34,"id":1303},"#user-content-fn-paiton",[33],"user-content-fnref-paiton","6",[10,1306,1307,1308,1311,1312,1315,1316],{},"Voor de oorspronkelijke v1.0.0-release controleerden we ook de reguliere API-server via ",[70,1309,1310],{},"vllm.entrypoints.openai.api_server",", los van de benchmarkomgeving. Die slaagde voor streamingchat, acht gelijktijdige verzoeken, een verzoek op de ingestelde contextgrens van 8K en een nieuw verzoek daarna. ",[13,1313,1314],{},"Alle 2.893 geïnstalleerde vLLM-bestanden kwamen overeen met de officiële basisimage."," Deze validatie geldt voor de vastgelegde geteste runtime en het ondersteunde profiel, niet voor elke vLLM-functie of toekomstige versie.",[26,1317,1318],{},[29,1319,149],{"href":684,"ariaDescribedBy":1320,"dataFootnoteRef":34,"id":1321},[33],"user-content-fnref-bench-21",[10,1323,1324],{},"Standaard-vLLM behoudt zijn gebruikelijke frameworkafhankelijkheden. De native bibliotheken van Paiton laden onafhankelijk van die frameworks. Dat maakt niet de volledige serving-stack frameworkvrij.",[10,1326,1327],{},"Dat alle verzoeken worden voltooid en de API-controles slagen, is nuttig om de betrouwbaarheid te toetsen. Het is geen onafhankelijke evaluatie van de modelnauwkeurigheid of garantie op identieke gegenereerde tekst tussen uitvoeringsprofielen.",[75,1329,1331],{"id":1330},"meer-uitvoer-uit-hetzelfde-actieve-uur","Meer uitvoer uit hetzelfde actieve uur",[10,1333,1334,1335,1337,1338,1341,1342,1344,1345,1348,1349,24],{},"De doorvoercijfers bij acht gelijktijdige verzoeken uit de volledige workload maken de capaciteitswinst concreet. Een volgehouden snelheid van ",[13,1336,671],{}," zou ongeveer ",[13,1339,1340],{},"721.000 uitvoertokens per actief uur"," opleveren. Bij ",[13,1343,905],{}," is dat ongeveer ",[13,1346,1347],{},"1,13 miljoen",": zo'n ",[13,1350,1351],{},"411.000 extra uitvoertokens in hetzelfde uur",[10,1353,1354,1355,668,1358,1361,1362,24],{},"Anders uitgedrukt: één miljoen uitvoertokens kost bij de referentiesnelheid ",[13,1356,1357],{},"1,387 actieve uren",[13,1359,1360],{},"0,883 uur"," met Paiton. Dat is ",[13,1363,1364],{},"36,3% minder actieve tijd",[10,1366,1367],{},[810,1368],{"alt":1369,"src":1370},"Bij volgehouden gemeten snelheden daalt de berekende actieve tijd per miljoen uitvoertokens van 1,387 naar 0,883 uur, een vermindering van 36,3 procent.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002F08-active-time-per-million.webp",[10,1372,1373,1376],{},[102,1374,1375],{},"Rekenvoorbeeld op basis van de doorvoer bij acht gelijktijdige verzoeken in de volledige workload. Het veronderstelt dat die snelheden worden volgehouden. Dit is geen meting van een uur, geen energiemeting en geen claim over financiële kosten.",[26,1377,1378],{},[29,1379,149],{"href":684,"ariaDescribedBy":1380,"dataFootnoteRef":34,"id":1381},[33],"user-content-fnref-bench-22",[10,1383,1384],{},[13,1385,1386],{},"De hardware verandert niet. Hoeveel nuttig werk die hardware kan leveren wel.",[75,1388,1390],{"id":1389},"oorspronkelijke-benchmarkconfiguratie","Oorspronkelijke benchmarkconfiguratie",[118,1392,1393,1403],{},[121,1394,1395],{},[124,1396,1397,1400],{},[127,1398,1399],{},"Onderdeel",[127,1401,1402],{},"Vergelijkbaar testprofiel",[135,1404,1405,1416,1426,1434,1442,1450,1458,1466,1474,1482,1490,1498],{},[124,1406,1407,1410],{},[140,1408,1409],{},"GPU",[140,1411,1412,1413],{},"Eén Radeon AI PRO R9700, ",[70,1414,1415],{},"gfx1201",[124,1417,1418,1421],{},[140,1419,1420],{},"Doelcheckpoint",[140,1422,1423],{},[70,1424,1425],{},"amd\u002FQwen3.8-27B-Quark-AWQ-MXFP4",[124,1427,1428,1431],{},[140,1429,1430],{},"Versnelde profielen",[140,1432,1433],{},"Radiance + DFlash2; Paiton op officieel vLLM + DFlash2",[124,1435,1436,1439],{},[140,1437,1438],{},"Serving-basis voor Paiton",[140,1440,1441],{},"Officiële vLLM 0.28 ROCm-runtime",[124,1443,1444,1447],{},[140,1445,1446],{},"Cache",[140,1448,1449],{},"FP8-KV; precies 5 GiB gereserveerd per engine",[124,1451,1452,1455],{},[140,1453,1454],{},"Contextlimiet",[140,1456,1457],{},"8.192 tokens per verzoek",[124,1459,1460,1463],{},[140,1461,1462],{},"Geteste gelijktijdige verzoeken",[140,1464,1465],{},"1, 2, 4 en 8",[124,1467,1468,1471],{},[140,1469,1470],{},"Speculatieve generatie",[140,1472,1473],{},"Dezelfde snapshots van doel- en draftmodel; zeven speculatieve tokens",[124,1475,1476,1479],{},[140,1477,1478],{},"Sampling",[140,1480,1481],{},"Greedy",[124,1483,1484,1487],{},[140,1485,1486],{},"Prefixcaching",[140,1488,1489],{},"Uitgeschakeld",[124,1491,1492,1495],{},[140,1493,1494],{},"Workload voor hoofdresultaat",[140,1496,1497],{},"Volledige preset met 188 verzoeken en oorspronkelijke uitvoerbudgetten",[124,1499,1500,1503],{},[140,1501,1502],{},"Aanvullende vergelijking met standaard-vLLM",[140,1504,1505],{},"Afzonderlijke matrix met 54 verzoeken en maximaal 128 uitvoertokens",[10,1507,1508,1509],{},"Deze resultaten gelden voor het geteste model, de runtime en de workload. Ze bieden geen garantie voor andere GPU's, langere contexten, andere draftmodellen of niet-geteste aantallen gelijktijdige verzoeken.",[26,1510,1511],{},[29,1512,149],{"href":684,"ariaDescribedBy":1513,"dataFootnoteRef":34,"id":1514},[33],"user-content-fnref-bench-23",[75,1516,1518],{"id":1517},"langere-gesprekken-twee-vrijgegeven-profielen","Langere gesprekken: twee vrijgegeven profielen",[10,1520,1521],{},[102,1522,1523,1524,1526],{},"Archief van 17 september: deze v1.1.0-profielen zijn niet de actuele ROCm 10-images. Gebruik de ",[29,1525,56],{"href":55}," voor de nieuwste release.",[10,1528,1529,1530,1533,1534],{},"Het oorspronkelijke resultaat beantwoordt een prestatievraag bij een context van 8K. Een praktisch endpoint voor programmeerwerk heeft ook ruimte nodig voor documenten, gespreksgeschiedenis en toolresultaten. De ",[13,1531,1532],{},"v1.1.0-images van 17 september"," breiden de beschikbare serving-profielen uit zonder de vastgelegde modelgewichten of bestaande native bibliotheken te veranderen.",[26,1535,1536],{},[29,1537,1541],{"href":1538,"ariaDescribedBy":1539,"dataFootnoteRef":34,"id":1540},"#user-content-fn-8",[33],"user-content-fnref-8","7",[118,1543,1544,1559],{},[121,1545,1546],{},[124,1547,1548,1551,1553,1556],{},[127,1549,1550],{},"Profiel",[127,1552,365],{"align":132},[127,1554,1555],{"align":132},"FP8-cachebudget",[127,1557,1558],{},"Limiet actieve sequenties",[135,1560,1561,1581],{},[124,1562,1563,1568,1573,1578],{},[140,1564,1565],{},[13,1566,1567],{},"64K v1.1.0",[140,1569,1570],{"align":132},[13,1571,1572],{},"65.536 tokens",[140,1574,1575],{"align":132},[13,1576,1577],{},"5 GiB",[140,1579,1580],{},"Maximaal 8, afhankelijk van de beschikbare cache",[124,1582,1583,1588,1593,1598],{},[140,1584,1585],{},[13,1586,1587],{},"200K v1.1.0",[140,1589,1590],{"align":132},[13,1591,1592],{},"200.000 tokens",[140,1594,1595],{"align":132},[13,1596,1597],{},"8 GiB",[140,1599,36],{},[10,1601,1602,1605,1606,1609],{},[13,1603,1604],{},"De context omvat het volledige tokenbudget van het verzoek:"," de getokeniseerde prompt, chat- en toolopmaak en de gegenereerde uitvoer. Reserveer ruimte voor het antwoord. Acht ingeplande sequenties betekent ",[13,1607,1608],{},"niet"," dat acht gesprekken van de volledige 64K-lengte tegelijk passen. Langere verzoeken gebruiken meer cache en kunnen in de wachtrij belanden of herberekening vereisen.",[10,1611,1612,1613,1616,1617,1623],{},"Dit zijn praktische serving-profielen, niet het architecturale maximum van het model. Het doel- en draftmodel vermelden 262.144 posities, maar de volledige serving-stack moet naast de gewichten, cache en het werkgeheugen passen. Het 200K-profiel heeft ",[13,1614,1615],{},"weinig VRAM-reserve op de R9700 met 32 GB"," en verwerkt één actief verzoek; andere verzoeken wachten. Behoud de meegeleverde instellingen voor prefill-blokken van 4.096 tokens en gelijktijdige verwerking.",[26,1618,1619],{},[29,1620,1541],{"href":1538,"ariaDescribedBy":1621,"dataFootnoteRef":34,"id":1622},[33],"user-content-fnref-8-2",[26,1624,1625],{},[29,1626,165],{"href":1627,"ariaDescribedBy":1628,"dataFootnoteRef":34,"id":1629},"#user-content-fn-9",[33],"user-content-fnref-9",[10,1631,1632,1633,1636,1637,1640,1641],{},"Een laatste controle van de verpakte image haalde drie markeringen terug uit een synthetische ",[13,1634,1635],{},"prompt van 195.999 tokens",", met een antwoord van 57 tokens. Dat is een afgebakende functionele controle van het 200K-profiel, ",[13,1638,1639],{},"geen brede validatie van redeneren of programmeren met lange context",". Deze controle staat los van de doorvoerbenchmarks. Ook twee ingediende prompts van 62.983 tokens werden op de 64K-image succesvol verwerkt, met gebruik van de wachtrij. Dat toont niet aan dat twee volledige contexten tegelijk in het geheugen passen.",[26,1642,1643],{},[29,1644,165],{"href":1627,"ariaDescribedBy":1645,"dataFootnoteRef":34,"id":1646},[33],"user-content-fnref-9-2",[75,1648,1650],{"id":1649},"toolaanroepen-die-de-client-bereiken","Toolaanroepen die de client bereiken",[10,1652,1653,1654,1657,1658,1664,1665,24,1671,1677],{},"De oorspronkelijke parser sloot niet aan op Qwens XML-formaat voor tools. Toolsyntaxis kon als gewone antwoordtekst verschijnen in plaats van als de ",[13,1655,1656],{},"gestructureerde API-aanroep"," die een client nodig heeft om een tool uit te voeren. De nieuwe images corrigeren die verwerking aan de serverkant met ",[13,1659,1660,1663],{},[70,1661,1662],{},"qwen3_xml"," voor toolparsing"," en ",[13,1666,1667,1670],{},[70,1668,1669],{},"qwen3"," voor reasoning-parsing",[26,1672,1673],{},[29,1674,1541],{"href":1538,"ariaDescribedBy":1675,"dataFootnoteRef":34,"id":1676},[33],"user-content-fnref-8-3",[26,1678,1679],{},[29,1680,165],{"href":1627,"ariaDescribedBy":1681,"dataFootnoteRef":34,"id":1682},[33],"user-content-fnref-9-3",[10,1684,1685,1688,1689,1692],{},[13,1686,1687],{},"In deze v1.1.0-images van 17 september is thinking standaard uitgeschakeld."," Applicaties kunnen het per verzoek inschakelen met ",[70,1690,1691],{},"\"chat_template_kwargs\": {\"enable_thinking\": true}",". Dat verandert het gedrag van het verzoek, niet de modelgewichten of de bytes van de native bibliotheken.",[10,1694,1695,1696,1701],{},"Beide gecorrigeerde images slaagden voor de gepubliceerde API-tooltests met en zonder streaming. Afzonderlijk slaagde de gecorrigeerde 64K-configuratie voor een daadwerkelijke controle van het lezen en schrijven van bestanden met OpenCode 1.18.31. Dit zijn afgebakende API- en clientcontroles, geen claim over algemene autonome programmeervaardigheid. De ",[29,1697,1700],{"href":1698,"rel":1699},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002Fbenchmarks\u002F2026-09-17-agentic-64k\u002FREADME.md#separate-long-context-and-tool-checks",[109],"onderbouwing van de tooltests"," beschrijft wat wel en niet is getest.",[75,1703,1705],{"id":1704},"de-64k-image-in-een-benchmark-met-korte-prompts","De 64K-image in een benchmark met korte prompts",[10,1707,1708,1709,1712,1713,1716,1717,1720,1721,24,1724],{},"Met de gecorrigeerde standaardinstellingen draaiden we de ",[13,1710,1711],{},"korte BetterBench-workload met 52 verzoeken"," op één R9700. Bij acht gelijktijdige verzoeken leverde de 64K-image ",[13,1714,1715],{},"304,10 uitvoertokens per seconde in totaal",", een ",[13,1718,1719],{},"mediane generatiesnelheid van 67,81 tok\u002Fs per verzoek"," en een ",[13,1722,1723],{},"mediane tijd tot het eerste token van 350,84 ms aan de clientkant",[26,1725,1726],{},[29,1727,165],{"href":1627,"ariaDescribedBy":1728,"dataFootnoteRef":34,"id":1729},[33],"user-content-fnref-9-4",[1731,1732],"benchmark-figure",{"kind":1733},"quick64k",[10,1735,1736],{},"Deze drie maten beantwoorden verschillende vragen. De generatiesnelheid per verzoek meet de uitvoer na de eerste gestreamde update; de totale doorvoer meet de voltooide uitvoer tijdens de fase met gelijktijdige verzoeken, inclusief prefill. De TTFT aan de clientkant meet het wachten op de eerste respons, inclusief HTTP en wachttijd op de server, maar exclusief de semafoor waarmee de client het aantal gelijktijdige verzoeken begrenst.",[10,1738,1739,1742,1743,1746],{},[13,1740,1741],{},"Dit zijn resultaten met korte prompts op een image die 64K ondersteunt, geen generatie met prompts van 64K."," De prompts in de gelijktijdigheidstest telden 69 tot 116 tokens. Er waren 10 opwarmverzoeken die niet meetelden, een uitvoerlimiet van 128 tokens en geen verzoekfouten of preëmpties. ",[13,1744,1745],{},"37 van de 52 gemeten antwoorden bereikten de limiet."," Succesvolle verzoeken en deze snelheden tonen dus niet aan hoe goed volledige taken worden afgerond.",[10,1748,1749,1750,1753,1754,1759,1760,1765,1766,24],{},"De nieuwe image schakelt thinking standaard uit; de eerdere release gebruikte de thinking-standaard van het checkpoint. Dat verandert de gegenereerde inhoud, lengtes en acceptatie van speculatieve tokens. ",[13,1751,1752],{},"Dit is geen gecontroleerde vergelijking van snelheidswinst ten opzichte van de eerdere release"," en vervangt het oorspronkelijke resultaat van 57% niet. Bekijk het ",[29,1755,1758],{"href":1756,"rel":1757},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002Fbenchmarks\u002F2026-09-17-agentic-64k\u002FREADME.md",[109],"volledige rapport en de methode",", de ",[29,1761,1764],{"href":1762,"rel":1763},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002Fbenchmarks\u002F2026-09-17-agentic-64k\u002Fsummary.json",[109],"samenvatting"," en de ",[29,1767,1770],{"href":1768,"rel":1769},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002Fbenchmarks\u002F2026-09-17-agentic-64k\u002Fdata\u002Fresults.json",[109],"resultaten per run",[75,1772,1774],{"id":1773},"groeiende-gesprekken-verwerk-dezelfde-geschiedenis-niet-opnieuw","Groeiende gesprekken: verwerk dezelfde geschiedenis niet opnieuw",[10,1776,1777],{},[102,1778,1779,1780,1783],{},"Onderzoek van 17 september. De metingen en beschikbaarheid hieronder beschrijven de oudere v1.1.0-images en experimentele adapter. Het nieuwe publieke chatprofiel staat ",[29,1781,1782],{"href":50},"hierboven",". Pas de oude cachebeperking voor 200K niet toe op dat afzonderlijk geteste profiel.",[10,1785,1786,1787,1790],{},"Een programmeeragent verstuurt vaak het gesprek tot dan toe opnieuw: instructies, eerdere antwoorden, bestandsfragmenten en toolresultaten, plus één nieuwe beurt. ",[13,1788,1789],{},"Met automatische prefixcaching (APC) kan de server een ongewijzigd, gecachet begin hergebruiken in plaats van die geschiedenis opnieuw te verwerken."," Dat kan meer verschil maken voor de wachttijd vóór een antwoord dan de decodesnelheid alleen.",[10,1792,1793,1794,1797,1798],{},"Dank aan de ",[13,1795,1796],{},"bijdrager uit de community die deze leemte aanwees en de tijdelijke oplossing demonstreerde",". Onze eerdere benchmarks met nieuwe prompts maten niet de kosten van het herhaald verwerken van een groeiende geschiedenis. APC is het bestaande hergebruikmechanisme van vLLM; het nieuwe onderzoek meet de integratie met Paiton en de bijbehorende afwegingen.",[26,1799,1800],{},[29,1801,1805],{"href":1802,"ariaDescribedBy":1803,"dataFootnoteRef":34,"id":1804},"#user-content-fn-10",[33],"user-content-fnref-10","9",[10,1807,1808,1809,1812,1813,1816],{},"Bij ongeveer 40K prompttokens verkortte het publiek reproduceerbare ",[13,1810,1811],{},"stock-GDN APC","-pad de wachttijd tot het antwoord begon van ",[13,1814,1815],{},"15,58 seconden bij een koude start naar 1,13 seconden bij herhaling",". Het compacte pad met APC uit bleef de herhaalde geschiedenis verwerken. Een experimentele native-prefill-APC-variant verkortte de wachttijd ook, onder meer bij groeiende vervolgverzoeken.",[1731,1818],{"kind":1819},"apc",[10,1821,1822,1823,1826,1827,1830,1831,1834,1835,1838,1839],{},"Het afzonderlijke experiment rond 150K gebruikte ",[13,1824,1825],{},"een cache van 8 GiB, een ingestelde context van 160.000 tokens en één actief verzoek",". De experimentele native-prefill-adapter verkortte de TTFT van ",[13,1828,1829],{},"88,46 seconden bij een koude start naar 2,04 seconden bij herhaling",". Een onafhankelijke herhaling met een tweede, andere prefix kwam uit op ",[13,1832,1833],{},"88,61 naar 2,03 seconden",". Dat zijn ",[13,1836,1837],{},"43 tot 44× kortere wachttijden tot het begin van een antwoord bij cachehits",", geen snellere decode, vergelijking met een concurrent of standaardvoordeel van de gepubliceerde image. De langste geteste prompt telde 150.645 tokens. Dit valideert dus geen gebruik van de volledige 160K of 200K.",[26,1840,1841],{},[29,1842,1805],{"href":1802,"ariaDescribedBy":1843,"dataFootnoteRef":34,"id":1844},[33],"user-content-fnref-10-2",[172,1846,1848],{"id":1847},"wat-op-17-september-beschikbaar-was","Wat op 17 september beschikbaar was",[1850,1851,1852,1859,1870,1879],"ul",{},[1853,1854,1855,1858],"li",{},[13,1856,1857],{},"De v1.1.0-images van 17 september hebben APC standaard uitgeschakeld."," Het compacte native pad van die release ondersteunt geen hergebruik van prefixes.",[1853,1860,1861,1869],{},[13,1862,1863,1864,24],{},"Stock-GDN APC kun je proberen via de ",[29,1865,1868],{"href":1866,"rel":1867},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002Fbenchmarks\u002F2026-09-17-prefix-caching\u002FREPRODUCE.md",[109],"gepubliceerde profielaanpassing en reproductie-instructies"," Dat recept gebruikt de vastgelegde 64K-image, een cache van 5 GiB en één actief verzoek.",[1853,1871,1872,1878],{},[13,1873,1874,1877],{},[70,1875,1876],{},"PAITON_PREFIX_CACHING=1"," wordt niet meegeleverd in deze images."," Alleen die gemaksschakelaar instellen activeert APC niet; gebruik de gedocumenteerde profielaanpassing.",[1853,1880,1881,1884],{},[13,1882,1883],{},"De native-prefill-APC-adapter is experimenteel en niet vrijgegeven."," De gemeten resultaten zijn niet te reproduceren met alleen de gepubliceerde image en het profiel.",[172,1886,1888],{"id":1887},"een-keuze-per-workload-met-echte-afwegingen","Een keuze per workload, met echte afwegingen",[10,1890,1891,1892,1895],{},"Het huidige stock-state-terugvalpad heeft ",[13,1893,1894],{},"lagere gemeten decodeprestaties en minder bruikbare cachecapaciteit"," dan het compacte pad met APC uit. Hergebruik van een lange geschiedenis kan nog steeds veel wachttijd besparen, maar nieuwe prompts, gewijzigde tokens aan het begin, verwijdering uit de cache en serverherstarts vereisen nieuwe verwerking. De 40K-vergelijkingen gebruikten hetzelfde budget van 5 GiB; het 150K-paneel is een afzonderlijk experiment met 8 GiB, geen vergelijking met een gelijk cachebudget tegenover het compacte pad.",[10,1897,1898,1901,1902],{},[13,1899,1900],{},"Pas stock-state-APC niet toe op het vrijgegeven 200K-profiel met de bestaande cache van 8 GiB."," In de vastgelegde capaciteitsberekening is dat budget onvoldoende bij een contextlimiet van 200K. Dit was een afwijzing op basis van de capaciteitsberekening, geen waargenomen GPU-geheugentekort tijdens uitvoering. Een grotere toewijzing is nog niet getest.",[26,1903,1904],{},[29,1905,1805],{"href":1802,"ariaDescribedBy":1906,"dataFootnoteRef":34,"id":1907},[33],"user-content-fnref-10-3",[10,1909,1910,1911,1916,1917,1920],{},"De gepubliceerde controles op het terugvinden van informatie, tools met gecachete context en groeiende geschiedenis vormen nuttige onderbouwing, geen brede certificering van modelkwaliteit of robuustheid. Het ",[29,1912,1915],{"href":1913,"rel":1914},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002Fbenchmarks\u002F2026-09-17-prefix-caching\u002FREADME.md",[109],"APC-rapport"," bevat de controlevarianten, controles bij cachemissers, gemeten afwegingen en beperkingen. De praktische les is om ",[13,1918,1919],{},"het gesprek"," te meten, niet alleen hoe snel het volgende antwoord wordt gegenereerd.",[75,1922,1924],{"id":1923},"aan-de-slag-op-je-r9700","Aan de slag op je R9700",[10,1926,1927],{},[102,1928,1929,1930,1933],{},"Historische opdrachten om de resultaten van 16\u002F17 september te reproduceren. Gebruik voor nieuwe deployments de ",[29,1931,1932],{"href":55},"ROCm 10-instructies"," hierboven, met het nieuwe checkpoint, de nieuwe launchers en de gewijzigde API-poort.",[10,1935,1936,1937,1942,1943,1765,1948,1953,1954,24,1957,1965],{},"Gebruik Linux x86-64, Docker en één Radeon AI PRO R9700 met werkende toegang tot de AMD-GPU. Begin met de ",[29,1938,1941],{"href":1939,"rel":1940},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002FLAUNCH-agentic-v1.1.0.md",[109],"gepubliceerde starthandleiding",", het ",[29,1944,1947],{"href":1945,"rel":1946},"https:\u002F\u002Fgithub.com\u002Fusers\u002FEliovp\u002Fpackages\u002Fcontainer\u002Fpackage\u002Fpaiton-vllm-plugin",[109],"GHCR-pakket",[29,1949,1952],{"href":1950,"rel":1951},"https:\u002F\u002Fhuggingface.co\u002FEliovpAI\u002FQwen3.8-27B-Quark-AWQ-MXFP4-DFlash2-Paiton-RDNA4",[109],"bijgewerkte Hugging Face-repository",". Die laatste behoudt de ongewijzigde native overlay van v1.0.0; de nieuwe serving-profielen zijn de ",[13,1955,1956],{},"GHCR-images van v1.1.0",[26,1958,1959],{},[29,1960,1964],{"href":1961,"ariaDescribedBy":1962,"dataFootnoteRef":34,"id":1963},"#user-content-fn-model",[33],"user-content-fnref-model","10",[26,1966,1967],{},[29,1968,1541],{"href":1538,"ariaDescribedBy":1969,"dataFootnoteRef":34,"id":1970},[33],"user-content-fnref-8-4",[10,1972,1973,1976],{},[13,1974,1975],{},"Draai slechts één profiel tegelijk op de GPU."," Beide nieuwe commando's delen het permanente cachevolume voor modellen en binden de API aan localhost. Bij de eerste start worden het vastgelegde doel- en draftmodel gedownload en geverifieerd. Wacht tot het opstarten is voltooid voordat je het endpoint gebruikt; stop de gekozen container voordat je van profiel wisselt. Je hoeft geen compilerbroncode op te halen of iets te bouwen.",[172,1978,1980],{"id":1979},"historisch-64k-v110-profiel","Historisch 64K-v1.1.0-profiel",[522,1982],{"profile":1983},"64k",[172,1985,1987],{"id":1986},"historisch-200k-v110-profiel","Historisch 200K-v1.1.0-profiel",[10,1989,1990],{},"Eén actief verzoek, een cache van 8 GiB en weinig VRAM-reserve. Behoud de meegeleverde instellingen voor gelijktijdige verwerking en prefill.",[522,1992],{"profile":1993},"200k",[10,1995,1996,1997,2000,2001,533,2004,2007],{},"Controleer of de server klaar is met ",[70,1998,1999],{},"curl --fail http:\u002F\u002F127.0.0.1:8000\u002Fhealth",". Gebruik basis-URL ",[70,2002,2003],{},"http:\u002F\u002F127.0.0.1:8000\u002Fv1",[70,2005,2006],{},"Qwen3.8-27B-Quark-AWQ-MXFP4",". Zo schakel je thinking expliciet in voor één verzoek:",[541,2009,2011],{"className":543,"code":2010,"language":545,"meta":34,"style":34},"curl --fail http:\u002F\u002F127.0.0.1:8000\u002Fv1\u002Fchat\u002Fcompletions \\\n  -H 'Content-Type: application\u002Fjson' \\\n  -d '{\"model\":\"Qwen3.8-27B-Quark-AWQ-MXFP4\",\"messages\":[{\"role\":\"user\",\"content\":\"Explain the tradeoffs of prefix caching.\"}],\"temperature\":0,\"max_tokens\":256,\"stream\":true,\"chat_template_kwargs\":{\"enable_thinking\":true}}'\n",[70,2012,2013,2024,2032],{"__ignoreMap":34},[549,2014,2015,2017,2019,2022],{"class":551,"line":552},[549,2016,556],{"class":555},[549,2018,560],{"class":559},[549,2020,2021],{"class":563}," http:\u002F\u002F127.0.0.1:8000\u002Fv1\u002Fchat\u002Fcompletions",[549,2023,577],{"class":559},[549,2025,2026,2028,2030],{"class":551,"line":567},[549,2027,583],{"class":559},[549,2029,586],{"class":563},[549,2031,577],{"class":559},[549,2033,2034,2036],{"class":551,"line":580},[549,2035,594],{"class":559},[549,2037,2038],{"class":563}," '{\"model\":\"Qwen3.8-27B-Quark-AWQ-MXFP4\",\"messages\":[{\"role\":\"user\",\"content\":\"Explain the tradeoffs of prefix caching.\"}],\"temperature\":0,\"max_tokens\":256,\"stream\":true,\"chat_template_kwargs\":{\"enable_thinking\":true}}'\n",[10,2040,2041,2042,2046],{},"Gebruik voor APC de afzonderlijke ",[29,2043,2045],{"href":1866,"rel":2044},[109],"stock-GDN-profielaanpassing",", niet een niet-ondersteunde omgevingsvariabele bij deze standaardcommando's.",[172,2048,2050],{"id":2049},"reproduceer-de-oorspronkelijke-8k-benchmark","Reproduceer de oorspronkelijke 8K-benchmark",[10,2052,2053,2054,2057,2058,24,2063],{},"De ",[13,2055,2056],{},"v1.0.0-image blijft ongewijzigd beschikbaar",", samen met de ",[29,2059,2062],{"href":2060,"rel":2061},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Freleases\u002Ftag\u002Fqwen38-mxfp4-dflash2-rdna4-v1.0.0",[109],"release notes van de runtime",[26,2064,2065],{},[29,2066,2070],{"href":2067,"ariaDescribedBy":2068,"dataFootnoteRef":34,"id":2069},"#user-content-fn-release",[33],"user-content-fnref-release","11",[522,2072],{"profile":2073},"original",[10,2075,2076,2077,1664,2082,2087,2088,2091],{},"Gebruik de ",[29,2078,2081],{"href":2079,"rel":2080},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Ftree\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2#run-the-v100-benchmark-release",[109],"oorspronkelijke modelhandleiding",[29,2083,2086],{"href":2084,"rel":2085},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002FBENCHMARKS.md",[109],"benchmarkinstellingen"," om de historische vergelijking te reproduceren. De cache van 5 GiB, limiet van 8.192 tokens, snapshots van doel- en draftmodel, het thinking-gedrag, de speculatieve instellingen en uitgeschakelde APC maken deel uit van het resultaat. De historische ",[70,2089,2090],{},"serve.py"," in de repository kiest nog steeds de vastgelegde oorspronkelijke release, niet een van de nieuwe profielen.",[75,2093,2095],{"id":2094},"dezelfde-hardware-duidelijk-meer-capaciteit","Dezelfde hardware. Duidelijk meer capaciteit.",[10,2097,2098,2101],{},[13,2099,2100],{},"57% meer totale doorvoer. Een 97% kortere mediane tijd tot het eerste token bij acht gelijktijdige verzoeken. 2,89× de geschatte cachecapaciteit."," Dat blijven de resultaten van de oorspronkelijke, gelijk opgezette 8K-vergelijking met 188 verzoeken op één Radeon AI PRO R9700 via regulier vLLM.",[10,2103,2104],{},"Die historische stappen leidden tot de actuele ROCm 10-release: 400,7 tok\u002Fs in totaal in een afzonderlijke 65K-test en een publiek uitvoerbaar experimenteel chatprofiel voor langere gesprekken. Verschillende checkpoints en workloads blijven gescheiden; de scope van de oorspronkelijke 57%-vergelijking verandert niet.",[10,2106,2107],{},"Voor lokale ontwikkelaars betekent dit een krachtiger gedeeld endpoint op één workstation-GPU. Voor teams die AMD-inference op grotere schaal draaien, laat het opnieuw zien waarom efficiënte uitvoering naast hardwarecapaciteit telt. De R9700-cijfers voorspellen geen winst op andere AMD-platforms.",[10,2109,2110,2111,2115],{},"Wil je meer uit je AMD-inferenceworkload halen? Bespreek met ons wat ",[29,2112,2114],{"href":2113},"\u002Fnl\u002Fproducts\u002Fpaiton","Paiton"," kan betekenen. Neem het model, de workload en de huidige referentiemetingen mee.",[172,2117,2119],{"id":2118},"dank-aan-de-betrokken-teams","Dank aan de betrokken teams",[10,2121,2122,2123,2127],{},"Dank aan het ",[29,2124,2126],{"href":736,"rel":2125},[109],"Radiance-team"," voor het uitstekende werk aan AMD-inference, de inspiratie en een sterke vergelijkingsbasis.",[10,2129,2130,2131,47,2136,2141,2142,2147],{},"We bedanken ook ",[29,2132,2135],{"href":2133,"rel":2134},"https:\u002F\u002Fgithub.com\u002Fvllm-project\u002Fvllm",[109],"vLLM",[29,2137,2140],{"href":2138,"rel":2139},"https:\u002F\u002Fcodeberg.org\u002FStillDeadcode\u002Flibr4d",[109],"StillDeadcode\u002Flibr4d",", de Qwen- en DFlash2-teams, het Quark-checkpointteam van AMD en ",[29,2143,2146],{"href":2144,"rel":2145},"https:\u002F\u002Fgithub.com\u002FGGZ14\u002FBetterBench",[109],"BetterBench"," voor de bouwstenen, modellen en meetinstrumenten waarop dit werk steunt.",[10,2149,2053,2150,2153],{},[29,2151,760],{"href":758,"rel":2152},[109]," benoemen de aangepaste technieken uit Radiance\u002Flibr4d en de toepasselijke voorwaarden per component. Dit artikel beschrijft alleen gepubliceerd serving-gedrag en metingen. Niet-openbare compilerdocumentatie en implementatiedetails blijven privé.",[172,2155,2157],{"id":2156},"praat-verder-met-de-community","Praat verder met de community",[10,2159,2160,2161,2166],{},"Vragen, ervaringen met de deployment of een workload die we hierna zouden moeten meten? Sluit aan bij de ",[29,2162,2165],{"href":2163,"rel":2164},"https:\u002F\u002Fwww.reddit.com\u002Fr\u002FROCm\u002Fcomments\u002F1whv60r\u002Fqwen38_27b_on_one_r9700_two_paitonvllm_benchmark\u002F",[109],"r\u002FROCm-discussie over deze Qwen3.8-resultaten",". De discussie gaat over twee afzonderlijke vergelijkingen. Beide behouden hun eigen methode en zijn niet uitwisselbaar met de korte benchmark van 17 september of de APC-experimenten.",[2168,2169],"hr",{},[2171,2172,2175,2180],"section",{"className":2173,"dataFootnotes":34},[2174],"footnotes",[75,2176,2179],{"className":2177,"id":33},[2178],"sr-only","Footnotes",[2181,2182,2183,2219,2399,2412,2424,2438,2449,2488,2534,2574,2586],"ol",{},[1853,2184,2186,47,2191,2196,2197,2204,2205,2204,2212],{"id":2185},"user-content-fn-11",[29,2187,2190],{"href":2188,"rel":2189},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002F8f56157c05eb6a53f6cdab00a115e47b42fed2d1\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002FREADME.md",[109],"Actuele release, benchmarktabellen en controles met lange context",[29,2192,2195],{"href":2193,"rel":2194},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002F8f56157c05eb6a53f6cdab00a115e47b42fed2d1\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002Flaunch-rocm10.py",[109],"publieke launcher en imagedigests",". Release van 18 september; geraadpleegd op 19 september 2026. Grafieken zijn gereproduceerd uit de afgeronde publieke tabellen, niet uit een onafhankelijk herhaalde benchmark. ",[29,2198,2203],{"href":2199,"ariaLabel":2200,"className":2201,"dataFootnoteBackref":34},"#user-content-fnref-11","Back to reference 1",[2202],"data-footnote-backref","↩"," ",[29,2206,2203,2210],{"href":2207,"ariaLabel":2208,"className":2209,"dataFootnoteBackref":34},"#user-content-fnref-11-2","Back to reference 1-2",[2202],[26,2211,149],{},[29,2213,2203,2217],{"href":2214,"ariaLabel":2215,"className":2216,"dataFootnoteBackref":34},"#user-content-fnref-11-3","Back to reference 1-3",[2202],[26,2218,750],{},[1853,2220,2222,2223,2227,2228,2204,2233,2204,2240,2204,2247,2204,2254,2204,2261,2204,2268,2204,2275,2204,2282,2204,2289,2204,2296,2204,2303,2204,2311,2204,2319,2204,2327,2204,2335,2204,2343,2204,2351,2204,2359,2204,2367,2204,2375,2204,2383,2204,2391],{"id":2221},"user-content-fn-bench","De aangeleverde benchmarksamenvatting en grafieken van ElioVP, met de ",[29,2224,2226],{"href":2084,"rel":2225},[109],"gepubliceerde Paiton-benchmarkonderbouwing",". De volledige workload gebruikt runs 495 \u002F 494; de vergelijking met beperkte uitvoerlengte gebruikt runs 403 \u002F 493 \u002F 492. De oorspronkelijke cijfers van 16 september komen uit de aangeleverde samenvatting, niet uit een hier gepubliceerd onbewerkt verzoeklog. De nieuwe grafieken van 17 september gebruiken de hieronder gelinkte publieke gegevens. ",[29,2229,2203],{"href":2230,"ariaLabel":2231,"className":2232,"dataFootnoteBackref":34},"#user-content-fnref-bench","Back to reference 2",[2202],[29,2234,2203,2238],{"href":2235,"ariaLabel":2236,"className":2237,"dataFootnoteBackref":34},"#user-content-fnref-bench-2","Back to reference 2-2",[2202],[26,2239,149],{},[29,2241,2203,2245],{"href":2242,"ariaLabel":2243,"className":2244,"dataFootnoteBackref":34},"#user-content-fnref-bench-3","Back to reference 2-3",[2202],[26,2246,750],{},[29,2248,2203,2252],{"href":2249,"ariaLabel":2250,"className":2251,"dataFootnoteBackref":34},"#user-content-fnref-bench-4","Back to reference 2-4",[2202],[26,2253,157],{},[29,2255,2203,2259],{"href":2256,"ariaLabel":2257,"className":2258,"dataFootnoteBackref":34},"#user-content-fnref-bench-5","Back to reference 2-5",[2202],[26,2260,1284],{},[29,2262,2203,2266],{"href":2263,"ariaLabel":2264,"className":2265,"dataFootnoteBackref":34},"#user-content-fnref-bench-6","Back to reference 2-6",[2202],[26,2267,1304],{},[29,2269,2203,2273],{"href":2270,"ariaLabel":2271,"className":2272,"dataFootnoteBackref":34},"#user-content-fnref-bench-7","Back to reference 2-7",[2202],[26,2274,1541],{},[29,2276,2203,2280],{"href":2277,"ariaLabel":2278,"className":2279,"dataFootnoteBackref":34},"#user-content-fnref-bench-8","Back to reference 2-8",[2202],[26,2281,165],{},[29,2283,2203,2287],{"href":2284,"ariaLabel":2285,"className":2286,"dataFootnoteBackref":34},"#user-content-fnref-bench-9","Back to reference 2-9",[2202],[26,2288,1805],{},[29,2290,2203,2294],{"href":2291,"ariaLabel":2292,"className":2293,"dataFootnoteBackref":34},"#user-content-fnref-bench-10","Back to reference 2-10",[2202],[26,2295,1964],{},[29,2297,2203,2301],{"href":2298,"ariaLabel":2299,"className":2300,"dataFootnoteBackref":34},"#user-content-fnref-bench-11","Back to reference 2-11",[2202],[26,2302,2070],{},[29,2304,2203,2308],{"href":2305,"ariaLabel":2306,"className":2307,"dataFootnoteBackref":34},"#user-content-fnref-bench-12","Back to reference 2-12",[2202],[26,2309,2310],{},"12",[29,2312,2203,2316],{"href":2313,"ariaLabel":2314,"className":2315,"dataFootnoteBackref":34},"#user-content-fnref-bench-13","Back to reference 2-13",[2202],[26,2317,2318],{},"13",[29,2320,2203,2324],{"href":2321,"ariaLabel":2322,"className":2323,"dataFootnoteBackref":34},"#user-content-fnref-bench-14","Back to reference 2-14",[2202],[26,2325,2326],{},"14",[29,2328,2203,2332],{"href":2329,"ariaLabel":2330,"className":2331,"dataFootnoteBackref":34},"#user-content-fnref-bench-15","Back to reference 2-15",[2202],[26,2333,2334],{},"15",[29,2336,2203,2340],{"href":2337,"ariaLabel":2338,"className":2339,"dataFootnoteBackref":34},"#user-content-fnref-bench-16","Back to reference 2-16",[2202],[26,2341,2342],{},"16",[29,2344,2203,2348],{"href":2345,"ariaLabel":2346,"className":2347,"dataFootnoteBackref":34},"#user-content-fnref-bench-17","Back to reference 2-17",[2202],[26,2349,2350],{},"17",[29,2352,2203,2356],{"href":2353,"ariaLabel":2354,"className":2355,"dataFootnoteBackref":34},"#user-content-fnref-bench-18","Back to reference 2-18",[2202],[26,2357,2358],{},"18",[29,2360,2203,2364],{"href":2361,"ariaLabel":2362,"className":2363,"dataFootnoteBackref":34},"#user-content-fnref-bench-19","Back to reference 2-19",[2202],[26,2365,2366],{},"19",[29,2368,2203,2372],{"href":2369,"ariaLabel":2370,"className":2371,"dataFootnoteBackref":34},"#user-content-fnref-bench-20","Back to reference 2-20",[2202],[26,2373,2374],{},"20",[29,2376,2203,2380],{"href":2377,"ariaLabel":2378,"className":2379,"dataFootnoteBackref":34},"#user-content-fnref-bench-21","Back to reference 2-21",[2202],[26,2381,2382],{},"21",[29,2384,2203,2388],{"href":2385,"ariaLabel":2386,"className":2387,"dataFootnoteBackref":34},"#user-content-fnref-bench-22","Back to reference 2-22",[2202],[26,2389,2390],{},"22",[29,2392,2203,2396],{"href":2393,"ariaLabel":2394,"className":2395,"dataFootnoteBackref":34},"#user-content-fnref-bench-23","Back to reference 2-23",[2202],[26,2397,2398],{},"23",[1853,2400,2402,2406,2407],{"id":2401},"user-content-fn-radiance",[29,2403,2405],{"href":736,"rel":2404},[109],"Documentatie van vLLM-Radiance",", met hetzelfde AMD Quark MXFP4-doelmodel, het DFlash2-profiel en expliciet gepubliceerde metingen op twee R9700's. Die externe metingen bieden context, maar vormen niet de referentie voor onze procentuele winst. ",[29,2408,2203],{"href":2409,"ariaLabel":2410,"className":2411,"dataFootnoteBackref":34},"#user-content-fnref-radiance","Back to reference 3",[2202],[1853,2413,2415,2418,2419],{"id":2414},"user-content-fn-betterbench",[29,2416,2146],{"href":2144,"rel":2417},[109],". De aantallen verzoeken, geselecteerde workloadinstellingen en bovenstaande resultaten komen uit onze aangeleverde runsamenvatting. ",[29,2420,2203],{"href":2421,"ariaLabel":2422,"className":2423,"dataFootnoteBackref":34},"#user-content-fnref-betterbench","Back to reference 4",[2202],[1853,2425,2427,2432,2433],{"id":2426},"user-content-fn-plugins",[29,2428,2431],{"href":2429,"rel":2430},"https:\u002F\u002Fdocs.vllm.ai\u002Fen\u002Flatest\u002Fdesign\u002Fplugin_system\u002F",[109],"Officiële documentatie van het vLLM-pluginsysteem",". ",[29,2434,2203],{"href":2435,"ariaLabel":2436,"className":2437,"dataFootnoteBackref":34},"#user-content-fnref-plugins","Back to reference 5",[2202],[1853,2439,2441,2432,2444],{"id":2440},"user-content-fn-paiton",[29,2442,2443],{"href":2113},"Productinformatie over Paiton",[29,2445,2203],{"href":2446,"ariaLabel":2447,"className":2448,"dataFootnoteBackref":34},"#user-content-fnref-paiton","Back to reference 6",[2202],[1853,2450,2452,1664,2456,2461,2462,2204,2467,2204,2474,2204,2481],{"id":2451},"user-content-fn-8",[29,2453,2455],{"href":1939,"rel":2454},[109],"Gepubliceerde startinstructies voor 64K\u002F200K v1.1.0",[29,2457,2460],{"href":2458,"rel":2459},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002Fruntime.agentic-v1.1.0.lock.json",[109],"onveranderlijke vastlegging van de images",". Geraadpleegd op 17 september 2026. ",[29,2463,2203],{"href":2464,"ariaLabel":2465,"className":2466,"dataFootnoteBackref":34},"#user-content-fnref-8","Back to reference 7",[2202],[29,2468,2203,2472],{"href":2469,"ariaLabel":2470,"className":2471,"dataFootnoteBackref":34},"#user-content-fnref-8-2","Back to reference 7-2",[2202],[26,2473,149],{},[29,2475,2203,2479],{"href":2476,"ariaLabel":2477,"className":2478,"dataFootnoteBackref":34},"#user-content-fnref-8-3","Back to reference 7-3",[2202],[26,2480,750],{},[29,2482,2203,2486],{"href":2483,"ariaLabel":2484,"className":2485,"dataFootnoteBackref":34},"#user-content-fnref-8-4","Back to reference 7-4",[2202],[26,2487,157],{},[1853,2489,2491,1759,2495,47,2498,1664,2502,2507,2508,2204,2513,2204,2520,2204,2527],{"id":2490},"user-content-fn-9",[29,2492,2494],{"href":1756,"rel":2493},[109],"Rapport over de korte benchmark van de 64K-image en toolondersteuning",[29,2496,1764],{"href":1762,"rel":2497},[109],[29,2499,2501],{"href":1768,"rel":2500},[109],"resultaten",[29,2503,2506],{"href":2504,"rel":2505},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002Fbenchmarks\u002F2026-09-17-agentic-64k\u002Fassets\u002Fconcurrency-64k-quick.svg",[109],"oorspronkelijke SVG",". De nieuwe grafieken zijn opnieuw getekend op basis van de gepubliceerde gegevens, in de huisstijl van ElioVP. ",[29,2509,2203],{"href":2510,"ariaLabel":2511,"className":2512,"dataFootnoteBackref":34},"#user-content-fnref-9","Back to reference 8",[2202],[29,2514,2203,2518],{"href":2515,"ariaLabel":2516,"className":2517,"dataFootnoteBackref":34},"#user-content-fnref-9-2","Back to reference 8-2",[2202],[26,2519,149],{},[29,2521,2203,2525],{"href":2522,"ariaLabel":2523,"className":2524,"dataFootnoteBackref":34},"#user-content-fnref-9-3","Back to reference 8-3",[2202],[26,2526,750],{},[29,2528,2203,2532],{"href":2529,"ariaLabel":2530,"className":2531,"dataFootnoteBackref":34},"#user-content-fnref-9-4","Back to reference 8-4",[2202],[26,2533,157],{},[1853,2535,2537,47,2541,47,2546,1664,2550,2554,2555,2204,2560,2204,2567],{"id":2536},"user-content-fn-10",[29,2538,2540],{"href":1913,"rel":2539},[109],"APC-onderzoek",[29,2542,2545],{"href":2543,"rel":2544},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002Fbenchmarks\u002F2026-09-17-prefix-caching\u002Fassets\u002Fplot-data.json",[109],"gepubliceerde grafiekgegevens",[29,2547,2506],{"href":2548,"rel":2549},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002Fbenchmarks\u002F2026-09-17-prefix-caching\u002Fassets\u002Fprefix-reuse-latency.svg",[109],[29,2551,2553],{"href":1866,"rel":2552},[109],"werkende reproductie-instructies voor stock-APC",". De native-prefill-APC-resultaten vereisen een niet-vrijgegeven adapter. ",[29,2556,2203],{"href":2557,"ariaLabel":2558,"className":2559,"dataFootnoteBackref":34},"#user-content-fnref-10","Back to reference 9",[2202],[29,2561,2203,2565],{"href":2562,"ariaLabel":2563,"className":2564,"dataFootnoteBackref":34},"#user-content-fnref-10-2","Back to reference 9-2",[2202],[26,2566,149],{},[29,2568,2203,2572],{"href":2569,"ariaLabel":2570,"className":2571,"dataFootnoteBackref":34},"#user-content-fnref-10-3","Back to reference 9-3",[2202],[26,2573,750],{},[1853,2575,2577,2432,2581],{"id":2576},"user-content-fn-model",[29,2578,2580],{"href":1950,"rel":2579},[109],"Bijbehorende Paiton-modelrelease op Hugging Face",[29,2582,2203],{"href":2583,"ariaLabel":2584,"className":2585,"dataFootnoteBackref":34},"#user-content-fnref-model","Back to reference 10",[2202],[1853,2587,2589,2593,2594],{"id":2588},"user-content-fn-release",[29,2590,2592],{"href":2060,"rel":2591},[109],"Paiton Qwen3.8 MXFP4 + DFlash2-runtimerelease",", met het runtimepakket en de release notes. ",[29,2595,2203],{"href":2596,"ariaLabel":2597,"className":2598,"dataFootnoteBackref":34},"#user-content-fnref-release","Back to reference 11",[2202],[2600,2601,2602],"style",{},"html pre.shiki code .sScJk, html code.shiki .sScJk{--shiki-default:#6F42C1;--shiki-dark:#B392F0}html pre.shiki code .sj4cs, html code.shiki .sj4cs{--shiki-default:#005CC5;--shiki-dark:#79B8FF}html pre.shiki code .sZZnC, html code.shiki .sZZnC{--shiki-default:#032F62;--shiki-dark:#9ECBFF}html .default .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}html.dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}",{"title":34,"searchDepth":567,"depth":567,"links":2604},[2605,2609,2610,2614,2615,2616,2617,2618,2619,2620,2621,2622,2623,2624,2625,2626,2627,2628,2632,2637,2641],{"id":77,"depth":567,"text":78,"children":2606},[2607,2608],{"id":174,"depth":580,"text":175},{"id":263,"depth":580,"text":264},{"id":349,"depth":567,"text":350},{"id":490,"depth":567,"text":491,"children":2611},[2612,2613],{"id":516,"depth":580,"text":517},{"id":600,"depth":580,"text":601},{"id":641,"depth":567,"text":642},{"id":692,"depth":567,"text":693},{"id":729,"depth":567,"text":730},{"id":785,"depth":567,"text":786},{"id":931,"depth":567,"text":932},{"id":975,"depth":567,"text":976},{"id":1037,"depth":567,"text":1038},{"id":1111,"depth":567,"text":1112},{"id":1266,"depth":567,"text":1267},{"id":1330,"depth":567,"text":1331},{"id":1389,"depth":567,"text":1390},{"id":1517,"depth":567,"text":1518},{"id":1649,"depth":567,"text":1650},{"id":1704,"depth":567,"text":1705},{"id":1773,"depth":567,"text":1774,"children":2629},[2630,2631],{"id":1847,"depth":580,"text":1848},{"id":1887,"depth":580,"text":1888},{"id":1923,"depth":567,"text":1924,"children":2633},[2634,2635,2636],{"id":1979,"depth":580,"text":1980},{"id":1986,"depth":580,"text":1987},{"id":2049,"depth":580,"text":2050},{"id":2094,"depth":567,"text":2095,"children":2638},[2639,2640],{"id":2118,"depth":580,"text":2119},{"id":2156,"depth":580,"text":2157},{"id":33,"depth":567,"text":2179},[2114,2643,2644,2645,2646,2647,2135],"AMD Radeon","Lokale AI","AI-inferentie","Inferentie-optimalisatie","Grote taalmodellen","2026-09-16T07:30:00Z","Qwen3.8 op één R9700: 400,7 tok\u002Fs met ROCm 10 en vLLM 0.29, plus publieke 200K\u002F220K-chatprofielen. Benchmarks, beperkingen en startopdrachten.","md","400,7 tok\u002Fs in totaal. Eén Radeon. Gewoon vLLM.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002Fupdate-2026-09-19\u002Fhero.webp",{},"https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700","\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700",{"title":5,"description":2649},"paiton-qwen38-mxfp4-dflash2-r9700","blog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700","2026-09-19T00:00:00Z","W9yfV_0vfk2UnJdVq5qWOZjVxWOl9oxUaVHSCXcPE8k",[2662,2664,2674,2686,2697,2710,2719,2734,2765,2777,2799,2817,2836,2855,2873,2890,2902,2918,2933,2945,2954,2962,2977,2989,3000,3011,3021,3034,3044,3057,3068,3078,3089,3098,3110,3121,3130],{"path":2655,"title":5,"description":2649,"date":2648,"slug":2657,"image":2652,"originalUrl":2654,"categories":2663},[2114,2643,2644,2645,2646,2647,2135],{"path":2665,"title":2666,"description":2667,"date":2668,"slug":2669,"image":2670,"originalUrl":2671,"categories":2672},"\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700","Qwen3.8 GGUF in vLLM: sneller antwoord op één Radeon","Draai de originele NEO CODER MAX GGUF met Paiton in vLLM op een R9700. Bekijk de gemeten responstijden, beeldinvoer en lokale installatie.","2026-09-14T07:30:00Z","paiton-qwen38-neo-gguf-vllm-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-neo-gguf\u002F00-hero-neo-gguf-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700",[2114,2643,2644,2673,2135],"GGUF",{"path":2675,"title":2676,"description":2677,"date":2678,"slug":2679,"image":2680,"originalUrl":2681,"categories":2682},"\u002Fblog\u002Fpaiton-minimax-h3-radeon-ai-pro-r9700","MiniMax H3 op Radeon: 15 seconden video met stereogeluid","Paiton genereert lokaal 15 seconden MiniMax H3-video met stereogeluid op één Radeon AI PRO R9700 in 5 min 33 s, met 16,7% minder wachttijd dan stock.","2026-09-09T07:30:00Z","paiton-minimax-h3-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-minimax-h3\u002F00-featured-minimax-h3-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-minimax-h3-radeon-ai-pro-r9700",[2114,2643,2644,2683,2684,2685],"Videogeneratie","MiniMax H3","ComfyUI",{"path":2687,"title":2688,"description":2689,"date":2690,"slug":2691,"image":2692,"originalUrl":2693,"categories":2694},"\u002Fblog\u002Fpaiton-flux2-klein-radeon-ai-pro-r9700","Lokale FLUX.2 klein op Radeon AI PRO R9700: sneller beelden genereren met minder VRAM","Paiton genereert FLUX.2 klein-beelden van 1024 × 1024 in 1,054 seconden op een R9700, met 16,2% minder generatietijd en 33,4% minder piekallocatie in Torch.","2026-09-07T09:00:00","paiton-flux2-klein-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-flux2-klein\u002Ffox-paiton.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-flux2-klein-radeon-ai-pro-r9700",[2114,2643,2644,2695,2696,2685],"Beeldgeneratie","FLUX",{"path":2698,"title":2699,"description":2700,"date":2701,"slug":2702,"image":2703,"originalUrl":2704,"categories":2705},"\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700","Ornith 1.5 haalt 44,6 tok\u002Fs op één Radeon AI PRO R9700","Paiton draait Ornith 1.5 35B A3B op één Radeon AI PRO R9700 met 44,63 outputtokens per seconde, 27% sneller en met 21,3% lagere gemodelleerde kosten.","2026-09-05T09:00:00","paiton-ornith15-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F00-featured-ornith15-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700",[2114,2706,2643,2645,2707,2708,2646,2647,2135,2709],"Kunstmatige intelligentie","GPU-prestaties","Inferentielatentie","Kostenefficiëntie",{"path":2711,"title":2712,"description":2713,"date":2714,"slug":2715,"image":2716,"originalUrl":2717,"categories":2718},"\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700","Paiton: 21% meer Qwen3.8-doorvoer op Radeon AI PRO R9700","Paiton draait AMD's Qwen3.8 27B op één Radeon AI PRO R9700 met 39,77 outputtokens per seconde. Dat levert 21% meer throughput en 17,4% lagere gemodelleerde kosten op.","2026-09-04T09:00:00","paiton-qwen38-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-r9700\u002F00-featured-paiton-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700",[2114,2706,2643,2645,2707,2708,2646,2647,2135,2709],{"path":2720,"title":2721,"description":2722,"date":2723,"slug":2724,"image":2725,"originalUrl":2726,"categories":2727},"\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt","Stroomvereisten voor AI-datacenters: de GPU-per-MW-illusie","Waarom verschillen GPU-aantallen per megawatt? Lees hoe PUE, piekbelasting, opslag, netwerken en koeling de inzetbare AI-capaciteit bepalen.","2026-07-27T23:52:00","ai-data-center-power-requirements-gpu-per-megawatt","\u002Fasset\u002Fimages\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt\u002Fgpu-per-megawatt-illusion.webp",null,[2728,2729,2730,2731,2732,2733],"Alle","AI-infrastructuur","Datacenters","ModFlex","HPC","AMD Helios",{"path":2735,"title":2736,"description":2737,"date":2738,"slug":2739,"image":2740,"originalUrl":2741,"categories":2742},"\u002Fblog\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","Wan2.2-videogeneratie: Paiton op AMD MI355X","Vergelijk Wan2.2-videogeneratie op AMD MI355X met Paiton en NVIDIA B200 via Diffusers. Lees hoe we diffusiemodellen optimaliseren.","2026-06-10T14:04:04","paiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonwan2.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x\u002F",[2728,2706,2114,2743,2744,2745,2746,2747,2748,2749,2750,2751,1409,2752,2753,2754,2755,2756,2757,2758,2114,2759,2760,2761,2762,2763,2764],"14B","AMD","B200","Benchmarks","Blackwell","Compute","Diffusie","Eliovp","Generatieve AI","Hardware","Inferentie","Instinct","MI355x","NVIDIA","On-premises","Optimalisatie","Soevereine AI","T2V","Tekst-naar-video","Tuning","Video-generatie","Wan2.2",{"path":2766,"title":2767,"description":2768,"date":2769,"slug":2770,"image":2771,"originalUrl":2772,"categories":2773},"\u002Fblog\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","ElioVP in De Tijd: chipoptimalisatie en datacenters","Lees hoe De Tijd ElioVP belicht, van de oorsprong in chipoptimalisatie tot het werk aan modulaire datacenters en koeling voor hoge vermogensdichtheid.","2026-02-10T20:48:12","from-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fphysicalnewspaper.webp","https:\u002F\u002Feliovp.com\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure\u002F",[2728,2706,2774,2775,2744,2776,2774,2756],"Modulaire DC","Niet gecategoriseerd","De Tijd",{"path":2778,"title":2779,"description":2780,"date":2781,"slug":2782,"image":2783,"originalUrl":2784,"categories":2785},"\u002Fblog\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","AI en privacy: een strategische prioriteit in de Benelux","Privacyrisico's van generatieve AI, vertrouwen, dataopslag en governance. Waarom bedrijven in de Benelux veilige AI strategisch moeten benaderen.","2026-01-29T13:51:11","privacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fheaderimage.webp","https:\u002F\u002Feliovp.com\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit\u002F",[2728,2706,2786,2775,2787,2788,2789,2790,2791,2792,2793,2794,2750,2795,2751,2796,2797,2798],"Trending","AI Act","Antropomorfisme","AVG","Benelux","ChatGPT","Cyberbeveiliging","Databeheer","Gegevensbeveiliging","GDPR","Microsoft Copilot","Privacy","Shadow AI",{"path":2800,"title":2801,"description":2802,"date":2803,"slug":2804,"image":2805,"originalUrl":2806,"categories":2807},"\u002Fblog\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","Waarom wij itsme niet gebruiken: privacy en soevereiniteit","Waarom ElioVP itsme niet gebruikt: onze afwegingen rond identiteitsmetadata, cloudafhankelijkheid, privacy en datasoevereiniteit.","2025-11-27T09:32:14","itsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontimage.webp","https:\u002F\u002Feliovp.com\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom\u002F",[2728,2808,2809,2810,2792,2811,2812,2813,2795,2814,2815,2816,2797],"AWS","Belgian Mobile ID","CLOUD Act","Datasoevereiniteit","Digitale identiteit","eIDAS","itsme","Liberty Global","MyGov.be",{"path":2818,"title":2819,"description":2820,"date":2821,"slug":2822,"image":2823,"originalUrl":2824,"categories":2825},"\u002Fblog\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025","Praktijkrapport: de realiteit van Agentic AI bouwen in 2025","Praktijklessen over lokale AI-agents in 2025 gaan in op workflowontwerp, observability, modeltraining, hallucinaties en GPU-geheugenlimieten.","2025-11-25T14:03:39","field-report-the-reality-of-building-agentic-ai-in-2025","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffieldreport.webp","https:\u002F\u002Feliovp.com\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025\u002F",[2728,2706,2826,2786,2827,2828,2829,2830,2831,2832,2833,2834,2759,2835],"Oplossingen","Agentic AI","AI-techniek","AI-strategie","Autonome agenten","Bedrijfs-AI","Lokale LLM","Modelverfijning","AI op locatie","VRAM-optimalisatie",{"path":2837,"title":2838,"description":2839,"date":2840,"slug":2841,"image":2842,"originalUrl":2843,"categories":2844},"\u002Fblog\u002Fthe-synthetic-unicorn-bubble","De synthetische unicornzeepbel","Een analyse van investeringsrisico’s bij AI-neoclouds: circulaire financiering, infrastructuurclaims, contractvoorwaarden en due diligence.","2025-11-24T19:22:28","the-synthetic-unicorn-bubble","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsyntheticunicorn.webp","https:\u002F\u002Feliovp.com\u002Fthe-synthetic-unicorn-bubble\u002F",[2728,2706,2786,2845,2846,2847,2848,2849,2850,2851,2852,2853,2854],"AI Infrastructure","AI Neocloud","Circulaire financiering","GPU Cloud","Beleggingsrisico's","Opstartwaardering","Synthetische bubbel","Technische analyse","Vaporware","Durfkapitaal",{"path":2856,"title":2857,"description":2858,"date":2859,"slug":2860,"image":2861,"originalUrl":2862,"categories":2863},"\u002Fblog\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","NVIDIA GB300 NVL72: modulair datacenter in vier maanden","Ontdek een modulair datacenterontwerp voor NVIDIA GB300 NVL72, met redundante voeding, hybride koeling en een bouwplanning van vier maanden.","2025-11-20T14:10:19","building-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsuperpodmodflexfrontimage.webp","https:\u002F\u002Feliovp.com\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power\u002F",[2728,2774,2775,2864,2729,2865,2866,2867,2868,2869,2870,2871,2872],"150 kW-rack","DLC","Hoge dichtheid","Vloeistofkoeling","Modulair datacenter","NVIDIA Blackwell Ultra","NVIDIA GB300","NVL72","Snelle implementatie",{"path":2874,"title":2875,"description":2876,"date":2877,"slug":2878,"image":2879,"originalUrl":2880,"categories":2881},"\u002Fblog\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential","CUDA-vertaling versus AMD-gerichte optimalisatie","Waarom CUDA-compatibiliteit niet hetzelfde is als AMD-prestaties: over ROCm, HIP, kerneloptimalisatie en hardwaregerichte afstemming.","2025-11-12T14:48:37","why-cuda-translation-wont-unlock-amds-real-potential","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fchatgpt-image-nov-11-2025-09_16_10-pm-1.webp","https:\u002F\u002Feliovp.com\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential\u002F",[2728,2706,2114,2775,2882,2706,2883,2884,2885,2886,2887,2888,2114,2889],"AMD MI300X","CUDA-vertaling","FP8","GPU-optimalisatie","High-performance computing","HIP","Kerneltuning","ROCm",{"path":2891,"title":2892,"description":2893,"date":2894,"slug":2895,"image":2896,"originalUrl":2897,"categories":2898},"\u002Fblog\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference","Paiton: snellere AI-inferentie in uw bestaande stack","Lees hoe Paiton aansluit op bestaande inferentiestacks, met AMD MI300X-benchmarks en vergelijkingen van prestaties per dollar.","2025-11-11T10:31:22","paiton-the-simplest-way-to-supercharge-ai-inference","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton-powaaah.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference\u002F",[2728,2706,2114,2645,2899,2882,2709,2900,2646,2888,2114,2901,2135],"AMD Instinct","Hoge throughput","SGLang",{"path":2903,"title":2904,"description":2905,"date":2906,"slug":2907,"image":2908,"originalUrl":2909,"categories":2910},"\u002Fblog\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","Paiton MoE-benchmarks: MI300X versus H200 en B200","Vergelijk Qwen3-30B-A3B MoE-benchmarks van MI300X met Paiton, H200 en B200: throughput en kosten per miljoen tokens.","2025-09-26T13:36:18","stop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhulkvshulkpaitonwins.webp","https:\u002F\u002Feliovp.com\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens\u002F",[2728,2706,2114,2911,2882,2912,2646,2913,2914,2915,2916,2114,2917],"AI-benchmarks","Kosten per token","Mixture of Experts","MoE","NVIDIA B200","NVIDIA H200","Qwen3",{"path":2919,"title":2920,"description":2921,"date":2922,"slug":2923,"image":2924,"originalUrl":2925,"categories":2926},"\u002Fblog\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","Lokale Agentic AI: van inbox naar actie","Lokale AI-agents zetten e-mails, documenten en beelden om in tickets, rapporten en acties, met modellen op maat van uw gegevens en systemen.","2025-09-16T13:09:00","agentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontfotoblog.webp","https:\u002F\u002Feliovp.com\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en\u002F",[2728,2706,2826,2775,2827,2927,2928,2929,2930,2832,2834,2759,2931,2932],"Schadedetectie","Documentverwerking","E-mailautomatisering","Factuurextractie","Ticketautomatisering","Workflowautomatisering",{"path":2934,"title":2935,"description":2936,"date":2937,"slug":2938,"image":2939,"originalUrl":2940,"categories":2941},"\u002Fblog\u002Fmi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","MI300X FP8-benchmarks: GPU-partitionering met Paiton","Bekijk hoe Paiton presteert met Llama 3.1 8B FP8 op gepartitioneerde MI300X-GPU's, vergeleken met NVIDIA H200 en B200.","2025-07-31T13:32:57","mi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fimage-2-1.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-fp8-data%e2%80%91parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach\u002F",[2728,2706,2114,2775,2942,2744,2745,2943,2944,2755,2756,2114,2135],"AI","H200","MI300X",{"path":2946,"title":2947,"description":2948,"date":2949,"slug":2950,"image":2951,"originalUrl":2952,"categories":2953},"\u002Fblog\u002Fapplicable-ai-for-businesses","Toepasbare AI voor bedrijven","Ontdek hoe ElioVP lokale AI voor bedrijfsprocessen bouwt, met modeltraining op maat en automatische schadedetectie voor de logistiek.","2025-07-09T21:35:30","applicable-ai-for-businesses","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fscherm_afbeelding-2025-07-09-om-23.30.17.webp","https:\u002F\u002Feliovp.com\u002Fapplicable-ai-for-businesses\u002F",[2728,2706,2826,2827,2927,2928,2929,2930,2832,2834,2759,2931,2932],{"path":2955,"title":2956,"description":2957,"date":2958,"slug":2959,"image":34,"originalUrl":2960,"categories":2961},"\u002Fblog\u002Fintroducing-paitons-free-evaluation-models","Maak kennis met de gratis evaluatiemodellen van Paiton","Test Paiton met gratis evaluatiemodellen voor AMD-GPU's. Vergelijk de prestaties voor tekst, beeldanalyse en beeldgeneratie met uw eigen workloads.","2025-07-07T11:26:13","introducing-paitons-free-evaluation-models","https:\u002F\u002Feliovp.com\u002Fintroducing-paitons-free-evaluation-models\u002F",[2728,2706,2114],{"path":2963,"title":2964,"description":2965,"date":2966,"slug":2967,"image":2968,"originalUrl":2969,"categories":2970},"\u002Fblog\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","Llama 3.1 405B: sneller starten met Paiton op MI300X","Bekijk Paiton-benchmarks voor Llama 3.1 405B op acht AMD MI300X-GPU's, met opstarttijd, tensorparallelisme, throughput en latency.","2025-06-12T20:15:23","paiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fservingscreenshot.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b\u002F",[2728,2706,2114,2775,2645,2882,2971,2884,2972,2973,2974,2114,2975,2976],"Koude start","Grafiekcompilatie","Llama 3.1 405B","LLM-optimalisatie","Opstartlatentie","Tensor-parallellisme",{"path":2978,"title":2979,"description":2980,"date":2981,"slug":2982,"image":2983,"originalUrl":2984,"categories":2985},"\u002Fblog\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x","Paiton FP8 verslaat NVIDIA's H200 op AMD's MI300X","Vergelijk Paiton op AMD MI300X met NVIDIA H200 voor Llama 3.1 70B FP8: throughput, wachttijd tot het eerste token en latency bij diverse batchgroottes.","2025-06-08T19:12:40","paiton-fp8-beats-nvidias-h200-on-amds-mi300x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fblognewfp8.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x\u002F",[2728,2706,2114,2775,2882,2986,2831,2751,2707,2708,2647,2973,2987,2988],"Koude startoptimalisatie","Model serving","vLLM-optimalisatie",{"path":2990,"title":2991,"description":2992,"date":2993,"slug":2994,"image":2995,"originalUrl":2996,"categories":2997},"\u002Fblog\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","MI300X, H200, RX 7900 XTX en n300s: vLLM-benchmarks","Vergelijk MI300X, H200, RX 7900 XTX en Tenstorrent n300s met vLLM: throughput, gemodelleerde tokenkosten en hardwarebeperkingen voor Llama 3 8B.","2025-05-09T14:03:58","mi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisontenstor.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm\u002F",[2728,2706,2114,2826,2775,2744,2944,2756,2998,2999],"RX7900XTX","tenstorrent",{"path":3001,"title":3002,"description":3003,"date":3004,"slug":3005,"image":3006,"originalUrl":3007,"categories":3008},"\u002Fblog\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","ClusterP&L: financiële modellen voor GPU-clusters","Ontdek hoe ClusterP&L kosten, rendement en investeringsscenario's voor GPU-clusters modelleert, met risicoanalyses en exporteerbare rapporten.","2025-05-03T10:52:22","clusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisonscenarios.webp","https:\u002F\u002Feliovp.com\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights\u002F",[2728,2706,2774,2826,2745,2943,3009,2756,3010],"MI325X","P&L-calculator",{"path":3012,"title":3013,"description":3014,"date":3015,"slug":3016,"image":3017,"originalUrl":3018,"categories":3019},"\u002Fblog\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","AMD MI300X versus NVIDIA H200: Qwen3-32B met Paiton","Vergelijk Qwen3-32B-benchmarks op AMD MI300X met Paiton en NVIDIA H200, met resultaten voor throughput, latency en hardwarekosten.","2025-05-02T21:10:30","cranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002F3ac59a73-2466-4422-b7e5-ef2e4a8ca58e.webp","https:\u002F\u002Feliovp.com\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200\u002F",[2728,2706,2114,2942,2744,2943,3020,2756,2114,2135],"MI300",{"path":3022,"title":3023,"description":3024,"date":3025,"slug":3026,"image":3027,"originalUrl":3028,"categories":3029},"\u002Fblog\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","Modulaire datacenters voor NVIDIA NVL: 1 tot 2 MW","Ontdek modulaire datacenterontwerpen voor NVIDIA NVL-systemen, met aandacht voor vermogen, vloeistofkoeling, redundantie en uitrolplanning.","2025-05-02T14:09:59","power-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Feliovp_critical-1mw-pod_rev-2_transparent.webp","https:\u002F\u002Feliovp.com\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw\u002F",[2728,2774,3030,2845,2866,2732,2867,2868,3031,3032,2871,3033],"1-2MW datacenter","NVIDIA Blackwell","NVIDIA NVL","Precisiekoeling",{"path":3035,"title":3036,"description":3037,"date":3038,"slug":3039,"image":3040,"originalUrl":3041,"categories":3042},"\u002Fblog\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","AI-agents in de medische wereld: AI die DICOM spreekt","Ontdek een lokale AI-agent die DICOM-gegevens opzoekt en bekijk tests van beeldmodellen met geanonimiseerde medische beelden.","2025-04-11T14:45:48","examining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhealthcareblog-1.webp","https:\u002F\u002Feliovp.com\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom\u002F",[2728,2706,2826,2775,2942,2744,3043],"Zorg",{"path":3045,"title":3046,"description":3047,"date":3048,"slug":3049,"image":3050,"originalUrl":3051,"categories":3052},"\u002Fblog\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","Amerikaanse invoerheffingen en AI-leveringszekerheid in 2025","Lees ElioVP's visie uit april 2025 op Amerikaanse invoerheffingen en leveringszekerheid voor AI-servers, HPC-systemen en modulaire datacenters.","2025-04-04T10:01:27","eliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftariffsshipping.webp","https:\u002F\u002Feliovp.com\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs\u002F",[2728,2786,2942,2744,3053,3054,3055,3056],"Invoer","Taiwan","Invoerheffingen","Trump",{"path":3058,"title":3059,"description":3060,"date":3061,"slug":3062,"image":3063,"originalUrl":3064,"categories":3065},"\u002Fblog\u002Fwhy-ai-agents-are-the-future","Waarom AI-agenten de toekomst zijn","Ontdek AI-agents voor ERP, CRM, financiën en klantondersteuning, met praktijkvoorbeelden en een traject van procesanalyse tot pilot en uitrol.","2025-03-23T22:06:59","why-ai-agents-are-the-future","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ferp2.jpeg","https:\u002F\u002Feliovp.com\u002Fwhy-ai-agents-are-the-future\u002F",[2728,2706,2826,2942,3066,3067],"AI-agenten","ERP",{"path":3069,"title":3070,"description":3071,"date":3072,"slug":3073,"image":3074,"originalUrl":3075,"categories":3076},"\u002Fblog\u002Fthe-rise-of-open-source-ai-model-optimization","De opkomst van open-source AI-modeloptimalisatie","Verken trends in opensource-AI-optimalisatie: kwantisatie, mixture-of-experts-modellen, hardwaregerichte afstemming, RAG en edge-AI.","2025-03-22T20:59:23","the-rise-of-open-source-ai-model-optimization","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Friseofopensource.jpeg","https:\u002F\u002Feliovp.com\u002Fthe-rise-of-open-source-ai-model-optimization\u002F",[2728,2706,2786,3077,2744,1409,2756],"AI-nieuws",{"path":3079,"title":3080,"description":3081,"date":3082,"slug":3083,"image":3084,"originalUrl":3085,"categories":3086},"\u002Fblog\u002Fintroducing-our-benchmarking-tool-powered-by-dstack","Maak kennis met onze benchmarktool, gebouwd op dstack","Ontdek onze benchmarktool met dstack: herhaalbare vLLM-tests, automatische parameterreeksen en prestatierapporten voor lokale GPU's en de cloud.","2025-03-20T14:21:59","introducing-our-benchmarking-tool-powered-by-dstack","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fbenchmarktool.jpeg","https:\u002F\u002Feliovp.com\u002Fintroducing-our-benchmarking-tool-powered-by-dstack\u002F",[2728,2706,2114,2942,2744,3087,3088,2944,2114],"benchmark","LLM",{"path":3090,"title":3091,"description":3092,"date":3093,"slug":3094,"image":3095,"originalUrl":3096,"categories":3097},"\u002Fblog\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","QwQ-32B optimaliseren (door Qwen): AMD MI300X versus NVIDIA H200","Vergelijk throughput en latency van QwQ-32B op AMD MI300X met Paiton en NVIDIA H200, bij kleine batches en meer gelijktijdige aanvragen.","2025-03-19T21:41:44","optimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton4.jpeg","https:\u002F\u002Feliovp.com\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200\u002F",[2728,2706,2114],{"path":3099,"title":3100,"description":3101,"date":3102,"slug":3103,"image":3104,"originalUrl":3105,"categories":3106},"\u002Fblog\u002Feliovp-featured-on-amd-tech-talk-podcast","Eliovp te gast in de AMD Tech Talk-podcast","Beluister Elio Van Puyvelde en Jim Greene in de AMD Tech Talk-podcast over het ontstaan van ElioVP en de hardware- en softwarediensten voor AI.","2025-03-19T07:53:39","eliovp-featured-on-amd-tech-talk-podcast","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftechtalkjimgreene.jpeg","https:\u002F\u002Feliovp.com\u002Feliovp-featured-on-amd-tech-talk-podcast\u002F",[2728,2744,3107,3108,3109],"Jim Greene","Podcast","Tech Talk",{"path":3111,"title":3112,"description":3113,"date":3114,"slug":3115,"image":3116,"originalUrl":3117,"categories":3118},"\u002Fblog\u002Ffurther-optimizing-amd-powered-inference-with-paiton","AMD-inferentie verder optimaliseren met Paiton","Bekijk Paiton-benchmarks voor DeepSeek R1 Distill Llama 8B op AMD MI300X, gericht op throughput en latency bij kleinere batchgroottes.","2025-03-13T06:18:30","further-optimizing-amd-powered-inference-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost3.webp","https:\u002F\u002Feliovp.com\u002Ffurther-optimizing-amd-powered-inference-with-paiton\u002F",[2728,2706,2114,2744,3119,3120,2943,2944,3009,2114,2135],"DeepSeek","H100",{"path":3122,"title":3123,"description":3124,"date":3125,"slug":3126,"image":3127,"originalUrl":3128,"categories":3129},"\u002Fblog\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","Paiton-benchmarks: DeepSeek R1 Distill Llama 3.1 8B","Vergelijk standaard- en Paiton-versies van DeepSeek R1 Distill Llama 3.1 8B op AMD MI300X, met benchmarks voor throughput en latency.","2025-01-31T09:11:02","a-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost2.webp","https:\u002F\u002Feliovp.com\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b\u002F",[2728,2706,2114,2744,3119,3120,2943,2944,3009,2114,2135],{"path":3131,"title":3132,"description":3133,"date":3134,"slug":3135,"image":3136,"originalUrl":3137,"categories":3138},"\u002Fblog\u002Fai-model-optimization-with-paiton","AI-modeloptimalisatie met Paiton","Lees hoe Paiton modelcompilatie, aangepaste kernels en kernelfusie inzet om AI-inferentie op AMD GPU's te optimaliseren.","2025-01-30T19:53:25","ai-model-optimization-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost1.webp","https:\u002F\u002Feliovp.com\u002Fai-model-optimization-with-paiton\u002F",[2728,2706,2114,2744,3120,2943,2944,3009,2114,2135],1789853167818]