[{"data":1,"prerenderedAt":1266},["ShallowReactive",2],{"blog-post-nl-\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700":3,"blog-posts-sidebar-nl":793},{"id":4,"title":5,"body":6,"categories":768,"date":779,"description":780,"extension":781,"heading":782,"image":783,"meta":784,"navigation":785,"originalUrl":786,"path":787,"seo":788,"slug":789,"stem":790,"updated":791,"__hash__":792},"blogNl\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700.md","Ornith 1.5 haalt 44,6 tok\u002Fs op één Radeon AI PRO R9700",{"type":7,"value":8,"toc":758},"minimark",[9,16,31,46,54,63,70,75,86,97,173,193,205,208,212,215,288,298,306,312,315,319,322,329,356,362,365,368,372,383,386,389,458,464,470,473,477,480,491,494,497,500,509,513,516,577,580,588,601,604,608,733,736,740,743,746,754],[10,11,12],"p",{},[13,14,15],"strong",{},"Eén workstation-GPU. Een antwoord van 256 tokens was na mediaan 5,12 seconden volledig gegenereerd. Zonder inferentie-API in de cloud.",[10,17,18,19,26,27,30],{},"Paiton draait het publiek beschikbare ",[20,21,25],"a",{"href":22,"rel":23},"https:\u002F\u002Fhuggingface.co\u002FCapicua25x\u002FOrnith-1.5-35B-A3B-MXFP4-Quark-RDNA4",[24],"nofollow","Ornith 1.5 35B A3B MXFP4-checkpoint"," met gemiddeld ",[13,28,29],{},"44,63 outputtokens per seconde"," op één AMD Radeon AI PRO R9700.",[10,32,33,34,37,38,41,42,45],{},"De snelste gekwalificeerde standaard-vLLM-configuratie op dezelfde machine behaalde ",[13,35,36],{},"35,13 outputtokens per seconde",". Paiton levert daarmee ",[13,39,40],{},"27,03% meer outputthroughput"," en verlaagt de gemodelleerde tijdsgebonden kosten per gegenereerde token met ",[13,43,44],{},"21,28%",".",[10,47,48,49,53],{},"Onze eerdere ",[20,50,52],{"href":51},"\u002Fnl\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700","Qwen3.8-benchmark"," testte drie verschillende promptprofielen. Deze release beantwoordt een andere vraag: passen een mixture-of-experts-model van ongeveer 35B, de speculatieve draft en een bruikbare servingruntime samen op één kaart van 32 GB, terwijl het systeem snel genoeg blijft voor lokaal gebruik?",[55,56,57],"blockquote",{},[10,58,59,62],{},[13,60,61],{},"Afbakening van de benchmark:"," 256 gevraagde inputtokens, 256 outputtokens, één actieve sequentie, temperatuur nul en thinking uitgeschakeld. Na toepassing van de chattemplate telden de prompts in werkelijkheid 268 tot 270 tokens. Het cijfer in de titel meet de generatie van outputtokens, niet de snelheid van promptverwerking, codering met een lange context, toolgebruik of gelijktijdige serving.",[10,64,65],{},[66,67],"img",{"alt":68,"src":69},"Paiton draait Ornith 1.5 met 44,63 outputtokens per seconde op één Radeon AI PRO R9700, 27,0% sneller dan het beste gekwalificeerde resultaat met standaard-vLLM.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F01-throughput-ornith15-eliovp.webp",[71,72,74],"h2",{"id":73},"een-35b-model-dat-echt-past","Een 35B-model dat echt past",[10,76,77,78,81,82,85],{},"Ornith 1.5 35B A3B is een mixture-of-experts-model. De aanduiding ",[13,79,80],{},"A3B"," betekent dat voor elke token ongeveer 3 miljard parameters worden geactiveerd. Dit betekent ",[13,83,84],{},"niet"," dat het volledige model evenveel geheugen inneemt als een 3B-model. De volledige verzameling experts moet nog steeds in het geheugen worden opgeslagen.",[10,87,88,89,92,93,96],{},"Het geteste MXFP4-target is ongeveer ",[13,90,91],{},"22,9 GB"," groot. De publieke DFlash-draft voegt daar ongeveer ",[13,94,95],{},"772 MB"," aan toe. Samen passen ze binnen de 32 GB VRAM van de R9700, inclusief de gekwalificeerde runtime en een gereserveerde KV-cache.",[98,99,100,113],"table",{},[101,102,103],"thead",{},[104,105,106,110],"tr",{},[107,108,109],"th",{},"Wat u nodig hebt",[107,111,112],{},"Gepubliceerd pakket",[114,115,116,125,133,141,149,157,165],"tbody",{},[104,117,118,122],{},[119,120,121],"td",{},"GPU",[119,123,124],{},"Eén Radeon AI PRO R9700, 32 GB",[104,126,127,130],{},[119,128,129],{},"Runtimeplatform",[119,131,132],{},"Linux, Docker en ROCm 7.14",[104,134,135,138],{},[119,136,137],{},"Download bij de eerste start",[119,139,140],{},"Target van 22,9 GB + draft van 772 MB",[104,142,143,146],{},[119,144,145],{},"Tijdelijk vrije schijfruimte",[119,147,148],{},"Ongeveer 48 GB tijdens de eerste voorbereiding",[104,150,151,154],{},[119,152,153],{},"Maximale context",[119,155,156],{},"8.192 tokens",[104,158,159,162],{},[119,160,161],{},"Toegang",[119,163,164],{},"Terminalchat + OpenAI-compatibele API",[104,166,167,170],{},[119,168,169],{},"Gekwalificeerd servingbereik",[119,171,172],{},"Alleen tekst, één actieve sequentie",[10,174,175,176,181,182,186,187,192],{},"De ",[20,177,180],{"href":178,"rel":179},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin",[24],"publieke runtimeplugin"," heeft een Apache 2.0-licentie. Het ",[20,183,185],{"href":22,"rel":184},[24],"targetcheckpoint"," heeft een MIT-licentie en de ",[20,188,191],{"href":189,"rel":190},"https:\u002F\u002Fhuggingface.co\u002Fz-lab\u002FQwen3.6-35B-A3B-DFlash",[24],"DFlash-draft"," heeft een Apache 2.0-licentie. De Paiton-compiler zelf wordt niet verspreid.",[10,194,195,196,201,202,204],{},"Het ",[20,197,200],{"href":198,"rel":199},"https:\u002F\u002Fhuggingface.co\u002Fornith-ai\u002FOrnith-1.5-35B-A3B",[24],"upstream Ornith-team"," richt zich op codeerwerk en agentic workflows. Het publiceert servingvoorbeelden met 262.144 tokens en toolgebruik. Dat maakt Ornith relevant voor lokaal gebruik en niet alleen voor een synthetische capaciteitstest. Die bredere mogelijkheden vallen echter ",[13,203,84],{}," binnen de kwalificatie van dit pakket. Het gepubliceerde Paiton-traject is beperkt tot 8.192 tokens en alleen tekst. Automatische toolselectie valt buiten het geteste bereik van deze release.",[10,206,207],{},"Die afbakening is belangrijk. Wie lokale AI evalueert, wil meer weten dan alleen of een checkpoint kan worden geladen: wat past er, wat start betrouwbaar, welke API is beschikbaar en waar houdt de kwalificatie op?",[71,209,211],{"id":210},"waar-de-winst-van-27-vandaan-komt","Waar de winst van 27% vandaan komt",[10,213,214],{},"Het grootste deel van de winst is al aanwezig voordat speculatieve decoding wordt ingeschakeld.",[98,216,217,234],{},[101,218,219],{},[104,220,221,224,228,231],{},[107,222,223],{},"Runtime",[107,225,227],{"align":226},"right","Outputtokens\u002Fs",[107,229,230],{"align":226},"Mediane TPOT",[107,232,233],{"align":226},"Verschil met standaard-vLLM",[114,235,236,250,266],{},[104,237,238,241,244,247],{},[119,239,240],{},"Snelste gekwalificeerde standaard-vLLM",[119,242,243],{"align":226},"35,132",[119,245,246],{"align":226},"27,457 ms",[119,248,249],{"align":226},"Referentie",[104,251,252,255,258,261],{},[119,253,254],{},"Paiton zonder DFlash",[119,256,257],{"align":226},"43,405",[119,259,260],{"align":226},"21,926 ms",[119,262,263],{"align":226},[13,264,265],{},"+23,55%",[104,267,268,273,278,283],{},[119,269,270],{},[13,271,272],{},"Paiton met DFlash, gemiddelde van twee runs",[119,274,275],{"align":226},[13,276,277],{},"44,628",[119,279,280],{"align":226},[13,281,282],{},"18,864 ms",[119,284,285],{"align":226},[13,286,287],{},"+27,03%",[10,289,290,291,294,295,45],{},"Zonder speculatieve decoding levert het Paiton-pad voor het targetmodel al ",[13,292,293],{},"23,55% meer throughput dan standaard-vLLM",". DFlash verhoogt het resultaat vervolgens van 43,405 naar 44,628 tokens per seconde, een extra winst van ",[13,296,297],{},"2,82% ten opzichte van Paiton zonder speculatie",[10,299,300,305],{},[20,301,304],{"href":302,"rel":303},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2602.06036",[24],"DFlash"," gebruikt een lichtgewicht block-diffusion-draftmodel om meerdere volgende tokens parallel voor te stellen. Ornith controleert die voorstellen, aanvaardt het geldige begin en behoudt de uiteindelijke controle over de gegenereerde output.",[10,307,308],{},[66,309],{"alt":310,"src":311},"DFlash stelt tokenblokken parallel voor en Ornith controleert ze. Paiton levert het grootste deel van de gemeten winst. DFlash voegt daar nog 2,8% aan toe ten opzichte van Paiton alleen.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F04-dflash-ornith15-eliovp.webp",[10,313,314],{},"DFlash zorgt voor de laatste versnelling, maar niet voor de volledige winst van 27%. Hier stopt de publieke technische toelichting. De gegenereerde kernels, fusiekeuzes, planningen en runtimemechanismen van Paiton blijven bedrijfseigen.",[71,316,318],{"id":317},"de-start-komt-20-ms-later-het-volledige-antwoord-266-seconden-eerder","De start komt 20 ms later, het volledige antwoord 2,66 seconden eerder",[10,320,321],{},"Generatiesnelheid is slechts één onderdeel van de gebruikerservaring. Een lokale gebruiker merkt ook hoe snel het model begint en hoelang het duurt voordat het volledige antwoord klaar is.",[10,323,324,325,328],{},"Voor deze workload nam de mediane tijd tot de eerste token toe van ongeveer ",[13,326,327],{},"290 ms tot 310 ms",". Zodra de generatie begon, maakte de snellere tokenstream die vertraging van 20 ms ruimschoots goed:",[330,331,332,343,349],"ul",{},[333,334,335,336,339,340,45],"li",{},"De mediane tijd per outputtoken daalde van ",[13,337,338],{},"27,46 ms tot 18,86 ms",", een vermindering van ",[13,341,342],{},"31,3%",[333,344,345,346,45],{},"De mediane end-to-endtijd daalde van ongeveer ",[13,347,348],{},"7,78 seconden tot 5,12 seconden",[333,350,351,352,355],{},"Het volledige antwoord van 256 tokens was ongeveer ",[13,353,354],{},"2,66 seconden eerder"," klaar.",[10,357,358],{},[66,359],{"alt":360,"src":361},"Paiton begint ongeveer 20 milliseconden later aan het Ornith 1.5-antwoord, maar voltooit het 2,66 seconden eerder.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F02-latency-ornith15-eliovp.webp",[10,363,364],{},"Dit is het volledige latencyverhaal: een iets tragere eerste token en een duidelijk sneller volledig antwoord. Bij speculatieve decoding meet TPOT het tempo van de tokenstream. Het is niet rechtstreeks het omgekeerde van de throughput van een volledig verzoek, omdat geaccepteerde tokens in blokken kunnen binnenkomen. De throughput van volledige verzoeken en de end-to-endtijd blijven hier de belangrijkste maatstaven.",[10,366,367],{},"Workloads die voornamelijk uit de verwerking van grote prompts bestaan, vereisen afzonderlijke metingen van de promptverwerking. Dit artikel leidt die niet af uit de decodethroughput.",[71,369,371],{"id":370},"meer-output-uit-hetzelfde-actieve-uur","Meer output uit hetzelfde actieve uur",[10,373,374,375,378,379,382],{},"Bij de gemeten snelheden heeft standaard-vLLM ongeveer ",[13,376,377],{},"7,91 actieve uren"," nodig om één miljoen outputtokens te genereren. Paiton met DFlash heeft ongeveer ",[13,380,381],{},"6,22 uur"," nodig.",[10,384,385],{},"Daarom leidt 27,03% meer throughput tot 21,28% lagere kosten: de kosten per token zijn omgekeerd evenredig met de throughput.",[10,387,388],{},"We gebruiken hetzelfde illustratieve eigendomsmodel als in het Qwen3.8-artikel, met 5.000 productieve inferentie-uren, hetzelfde systeemverbruik van 450 W, aankoopprijzen van $ 1.299 of € 1.749 en elektriciteitstarieven van $ 0,17 of € 0,2558 per kWh. Dat geeft het volgende resultaat:",[98,390,391,404],{},[101,392,393],{},[104,394,395,398,401],{},[107,396,397],{},"Economie van interactieve tokens",[107,399,400],{"align":226},"Gekwalificeerde standaard-vLLM",[107,402,403],{"align":226},"Paiton + DFlash",[114,405,406,419,432,445],{},[104,407,408,411,414],{},[119,409,410],{},"Uren per miljoen outputtokens",[119,412,413],{"align":226},"7,91",[119,415,416],{"align":226},[13,417,418],{},"6,22",[104,420,421,424,427],{},[119,422,423],{},"Gemodelleerde Amerikaanse kosten per miljoen",[119,425,426],{"align":226},"$ 2,66",[119,428,429],{"align":226},[13,430,431],{},"$ 2,09",[104,433,434,437,440],{},[119,435,436],{},"Gemodelleerde Europese kosten per miljoen",[119,438,439],{"align":226},"€ 3,68",[119,441,442],{"align":226},[13,443,444],{},"€ 2,89",[104,446,447,450,453],{},[119,448,449],{},"Output over 5.000 actieve uren",[119,451,452],{"align":226},"632,4 miljoen",[119,454,455],{"align":226},[13,456,457],{},"803,3 miljoen",[10,459,460,461,45],{},"Volgens dit model produceert dezelfde kaart over 5.000 productieve uren ongeveer ",[13,462,463],{},"171 miljoen extra outputtokens",[10,465,466],{},[66,467],{"alt":468,"src":469},"Bij 5.000 productieve inferentie-uren dalen de gemodelleerde Europese kosten met Paiton en DFlash van € 3,68 naar € 2,89 per miljoen outputtokens.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F03-economics-ornith15-eliovp.webp",[10,471,472],{},"Dit is een tijdsgebonden eigendomsmodel en geen claim over gemeten energie-efficiëntie aan het stopcontact. Het model gaat uit van hetzelfde systeemverbruik en houdt geen rekening met de hostcomputer, inactieve tijd, koeling, onderhoud, financiering, belastingen of restwaarde.",[71,474,476],{"id":475},"waarom-de-vergelijking-met-standaard-vllm-geloofwaardig-is","Waarom de vergelijking met standaard-vLLM geloofwaardig is",[10,478,479],{},"We vergeleken Paiton niet met een standaardinstallatie of een bewust zwakke configuratie. De geselecteerde standaardconfiguratie was het snelste stabiele resultaat dat we behaalden na tests met de beschikbare instellingen voor uitvoering, graphs, attention, recurrente verwerking en mixture-of-experts.",[10,481,482,483,487,488,45],{},"De configuratie gebruikte de vastgezette, ongewijzigde ROCm-versie van vLLM, O2-compilatie, graph capture met batchgrootte één, Triton-attention, Triton GDN-decode, de niet-gefuseerde Triton MoE-backend, uitgeschakelde DFlash en hetzelfde ondersteunde prestatieniveau ",[484,485,486],"code",{},"AUTO"," met het vermogensprofiel ",[484,489,490],{},"COMPUTE",[10,492,493],{},"Beide configuraties gebruikten dezelfde GPU, hetzelfde checkpoint, dezelfde tokenizer, vastgezette vLLM-revisie, verzoekgegevens, random seed, outputlengte, concurrency en hetzelfde GPU-profiel. Voor het headlinecijfer krijgt standaard-vLLM zijn snelste gekwalificeerde resultaat. Dat vergelijken we met het gemiddelde van twee Paiton-runs, telkens vanaf een nieuw gestarte server.",[10,495,496],{},"De standaardconfiguratie voltooide alle 12 gemeten verzoeken. De twee Paiton-runs voltooiden alle 24 verzoeken en leverden telkens het gevraagde aantal outputtokens. Een deterministisch verzoek in natuurlijke taal voor en na de Paiton-runs bleef leesbaar, stopte op een natuurlijke manier, leverde eindige logwaarschijnlijkheden op en was byte-identiek.",[10,498,499],{},"Die laatste stap is een praktische controle op correcte serving. Het is geen academische nauwkeurigheidsevaluatie, codeerbenchmark of bewijs dat de kwaliteit gelijk is aan die van het upstream model. Test het gekwantiseerde checkpoint voor implementatie met uw eigen prompts en acceptatiecriteria.",[10,501,502,503,508],{},"Het publieke ",[20,504,507],{"href":505,"rel":506},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FOrnith-1.5\u002FBENCHMARKS.md",[24],"Ornith-benchmarkrapport"," bevat de gepubliceerde workload, standaardinstellingen en het reproductiecommando.",[71,510,512],{"id":511},"ornith-15-lokaal-uitvoeren","Ornith 1.5 lokaal uitvoeren",[10,514,515],{},"Dit is een gecontroleerd traject voor Linux en Docker op één Radeon AI PRO R9700 met ROCm 7.14. Start de server en open de meegeleverde terminalchat met één commando:",[517,518,523],"pre",{"className":519,"code":520,"language":521,"meta":522,"style":522},"language-bash shiki shiki-themes github-light github-dark","git clone --depth 1 https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin.git \\\n  && cd paiton-vllm-plugin \\\n  && .\u002Fmodels\u002FOrnith-1.5\u002Fserve-docker.sh --chat\n","bash","",[484,524,525,551,566],{"__ignoreMap":522},[526,527,530,534,538,542,545,548],"span",{"class":528,"line":529},"line",1,[526,531,533],{"class":532},"sScJk","git",[526,535,537],{"class":536},"sZZnC"," clone",[526,539,541],{"class":540},"sj4cs"," --depth",[526,543,544],{"class":540}," 1",[526,546,547],{"class":536}," https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin.git",[526,549,550],{"class":540}," \\\n",[526,552,554,558,561,564],{"class":528,"line":553},2,[526,555,557],{"class":556},"sVt8B","  && ",[526,559,560],{"class":540},"cd",[526,562,563],{"class":536}," paiton-vllm-plugin",[526,565,550],{"class":540},[526,567,569,571,574],{"class":528,"line":568},3,[526,570,557],{"class":556},[526,572,573],{"class":532},".\u002Fmodels\u002FOrnith-1.5\u002Fserve-docker.sh",[526,575,576],{"class":540}," --chat\n",[10,578,579],{},"Bij de eerste start worden het vastgezette publieke target en de DFlash-draft gedownload. Daarna maakt het systeem een gebruiksklare kopie in een permanent Docker-volume. Dezelfde server biedt een OpenAI-compatibel endpoint op:",[517,581,586],{"className":582,"code":584,"language":585,"meta":522},[583],"language-text","http:\u002F\u002F127.0.0.1:8000\u002Fv1\u002Fchat\u002Fcompletions\n","text",[484,587,584],{"__ignoreMap":522},[10,589,590,591,594,595,600],{},"Gebruik de modelnaam ",[484,592,593],{},"ornith",". De publieke ",[20,596,599],{"href":597,"rel":598},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Ftree\u002Fmain\u002Fmodels\u002FOrnith-1.5",[24],"pakketdocumentatie"," bevat het rechtstreekse Docker-commando, de optie om DFlash uit te schakelen en de exacte gebruiksgrenzen.",[10,602,603],{},"De image bevat de runtimeplugin en het gecompileerde Paiton-artefact. Ze bevat geen modelgewichten en geen broncode van de Paiton-compiler.",[71,605,607],{"id":606},"geteste-configuratie","Geteste configuratie",[98,609,610,620],{},[101,611,612],{},[104,613,614,617],{},[107,615,616],{},"Onderdeel",[107,618,619],{},"Geteste waarde",[114,621,622,632,640,650,658,666,676,686,696,704,711,717,725],{},[104,623,624,626],{},[119,625,121],{},[119,627,628,629],{},"AMD Radeon AI PRO R9700, 32 GB, ",[484,630,631],{},"gfx1201",[104,633,634,637],{},[119,635,636],{},"Model",[119,638,639],{},"Ornith 1.5 35B A3B MXFP4 Quark RDNA4",[104,641,642,645],{},[119,643,644],{},"Modelrevisie",[119,646,647],{},[484,648,649],{},"9e488f46c0f7969f84c9923ee0256311cd50316e",[104,651,652,655],{},[119,653,654],{},"Grootte target \u002F draft",[119,656,657],{},"22,9 GB \u002F 772 MB",[104,659,660,663],{},[119,661,662],{},"ROCm",[119,664,665],{},"7.14",[104,667,668,671],{},[119,669,670],{},"vLLM-revisie",[119,672,673],{},[484,674,675],{},"39bd959b582c85e78e7e0326d49042ce7c3c07ed",[104,677,678,681],{},[119,679,680],{},"Paiton-image",[119,682,683],{},[484,684,685],{},"ghcr.io\u002Feliovp\u002Fpaiton-vllm-plugin:ornith15-mxfp4-rdna4-v1.0.0",[104,687,688,691],{},[119,689,690],{},"Geteste digest",[119,692,693],{},[484,694,695],{},"sha256:f8feb0ea85e36f681eaf4f6c1d534551e4e0d1d98bf479f1cb6b6236a5893de2",[104,697,698,701],{},[119,699,700],{},"Tensorparallelisme",[119,702,703],{},"1",[104,705,706,709],{},[119,707,708],{},"Maximaal aantal actieve sequenties",[119,710,703],{},[104,712,713,715],{},[119,714,153],{},[119,716,156],{},[104,718,719,722],{},[119,720,721],{},"Gereserveerde KV-cache",[119,723,724],{},"3 GiB",[104,726,727,730],{},[119,728,729],{},"Gekwalificeerd bereik",[119,731,732],{},"Alleen tekst, inferentie voor één gebruiker",[10,734,735],{},"Het pakket weigert te starten wanneer de GPU, het checkpoint of het servingcontract niet wordt ondersteund. Extra verzoeken worden in een wachtrij geplaatst in plaats van een niet-gekwalificeerd gelijktijdig traject te gebruiken.",[71,737,739],{"id":738},"van-een-workstationresultaat-naar-economische-impact-in-productie","Van een workstationresultaat naar economische impact in productie",[10,741,742],{},"De Qwen3.8-release liet zien dat Paiton drie verschillende promptprofielen op de R9700 versnelde. Ornith voegt een ander bewijs toe: een 35B MoE-target en een speculatieve draft passen op één kaart van 32 GB, werken via een vertrouwde API en genereren 44,63 outputtokens per seconde.",[10,744,745],{},"Voor lokale gebruikers betekent dit een sneller privé-modelendpoint zonder afhankelijkheid van een gehoste prijs per token. Voor operators met AMD Instinct CDNA-infrastructuur is de hefboom groter: elk procent winst telt door over accelerators, modellen en miljarden gegenereerde tokens.",[10,747,748,749,753],{},"Draait u een AMD-tokenfabriek? ",[20,750,752],{"href":751},"\u002Fnl\u002Fproducts\u002Fpaiton","Bezorg ons uw model, verkeersprofiel en huidige baseline",". Wij tonen waar throughput, latency en kosten per gegenereerde token kunnen verbeteren.",[755,756,757],"style",{},"html pre.shiki code .sScJk, html code.shiki .sScJk{--shiki-default:#6F42C1;--shiki-dark:#B392F0}html pre.shiki code .sZZnC, html code.shiki .sZZnC{--shiki-default:#032F62;--shiki-dark:#9ECBFF}html pre.shiki code .sj4cs, html code.shiki .sj4cs{--shiki-default:#005CC5;--shiki-dark:#79B8FF}html pre.shiki code .sVt8B, html code.shiki .sVt8B{--shiki-default:#24292E;--shiki-dark:#E1E4E8}html .default .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}html.dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}",{"title":522,"searchDepth":553,"depth":553,"links":759},[760,761,762,763,764,765,766,767],{"id":73,"depth":553,"text":74},{"id":210,"depth":553,"text":211},{"id":317,"depth":553,"text":318},{"id":370,"depth":553,"text":371},{"id":475,"depth":553,"text":476},{"id":511,"depth":553,"text":512},{"id":606,"depth":553,"text":607},{"id":738,"depth":553,"text":739},[769,770,771,772,773,774,775,776,777,778],"Paiton","Kunstmatige intelligentie","AMD Radeon","AI-inferentie","GPU-prestaties","Inferentielatentie","Inferentie-optimalisatie","Grote taalmodellen","vLLM","Kostenefficiëntie","2026-09-05T09:00:00","Paiton draait Ornith 1.5 35B A3B op één Radeon AI PRO R9700 met 44,63 outputtokens per seconde, 27% sneller en met 21,3% lagere gemodelleerde kosten.","md","Een 35B MoE met 44,6 tok\u002Fs op één GPU van 32 GB","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F00-featured-ornith15-r9700.webp",{},true,"https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700","\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700",{"title":5,"description":780},"paiton-ornith15-radeon-ai-pro-r9700","blog\u002Fpaiton-ornith15-radeon-ai-pro-r9700",null,"4fLoCeHi4arUCPXS38M18crRdWR5nKgTaqOv1x1lRro",[794,804,814,826,837,839,848,862,893,905,927,945,964,983,1001,1017,1029,1045,1060,1072,1081,1089,1104,1116,1127,1138,1148,1161,1171,1184,1195,1205,1216,1225,1237,1248,1257],{"path":795,"title":796,"description":797,"date":798,"slug":799,"image":800,"originalUrl":801,"categories":802},"\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700","Qwen3.8: 400,7 tok\u002Fs op één R9700 | Paiton","Qwen3.8 op één R9700: 400,7 tok\u002Fs met ROCm 10 en vLLM 0.29, plus publieke 200K\u002F220K-chatprofielen. Benchmarks, beperkingen en startopdrachten.","2026-09-16T07:30:00Z","paiton-qwen38-mxfp4-dflash2-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002Fupdate-2026-09-19\u002Fhero.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700",[769,771,803,772,775,776,777],"Lokale AI",{"path":805,"title":806,"description":807,"date":808,"slug":809,"image":810,"originalUrl":811,"categories":812},"\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700","Qwen3.8 GGUF in vLLM: sneller antwoord op één Radeon","Draai de originele NEO CODER MAX GGUF met Paiton in vLLM op een R9700. Bekijk de gemeten responstijden, beeldinvoer en lokale installatie.","2026-09-14T07:30:00Z","paiton-qwen38-neo-gguf-vllm-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-neo-gguf\u002F00-hero-neo-gguf-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700",[769,771,803,813,777],"GGUF",{"path":815,"title":816,"description":817,"date":818,"slug":819,"image":820,"originalUrl":821,"categories":822},"\u002Fblog\u002Fpaiton-minimax-h3-radeon-ai-pro-r9700","MiniMax H3 op Radeon: 15 seconden video met stereogeluid","Paiton genereert lokaal 15 seconden MiniMax H3-video met stereogeluid op één Radeon AI PRO R9700 in 5 min 33 s, met 16,7% minder wachttijd dan stock.","2026-09-09T07:30:00Z","paiton-minimax-h3-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-minimax-h3\u002F00-featured-minimax-h3-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-minimax-h3-radeon-ai-pro-r9700",[769,771,803,823,824,825],"Videogeneratie","MiniMax H3","ComfyUI",{"path":827,"title":828,"description":829,"date":830,"slug":831,"image":832,"originalUrl":833,"categories":834},"\u002Fblog\u002Fpaiton-flux2-klein-radeon-ai-pro-r9700","Lokale FLUX.2 klein op Radeon AI PRO R9700: sneller beelden genereren met minder VRAM","Paiton genereert FLUX.2 klein-beelden van 1024 × 1024 in 1,054 seconden op een R9700, met 16,2% minder generatietijd en 33,4% minder piekallocatie in Torch.","2026-09-07T09:00:00","paiton-flux2-klein-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-flux2-klein\u002Ffox-paiton.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-flux2-klein-radeon-ai-pro-r9700",[769,771,803,835,836,825],"Beeldgeneratie","FLUX",{"path":787,"title":5,"description":780,"date":779,"slug":789,"image":783,"originalUrl":786,"categories":838},[769,770,771,772,773,774,775,776,777,778],{"path":840,"title":841,"description":842,"date":843,"slug":844,"image":845,"originalUrl":846,"categories":847},"\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700","Paiton: 21% meer Qwen3.8-doorvoer op Radeon AI PRO R9700","Paiton draait AMD's Qwen3.8 27B op één Radeon AI PRO R9700 met 39,77 outputtokens per seconde. Dat levert 21% meer throughput en 17,4% lagere gemodelleerde kosten op.","2026-09-04T09:00:00","paiton-qwen38-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-r9700\u002F00-featured-paiton-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700",[769,770,771,772,773,774,775,776,777,778],{"path":849,"title":850,"description":851,"date":852,"slug":853,"image":854,"originalUrl":791,"categories":855},"\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt","Stroomvereisten voor AI-datacenters: de GPU-per-MW-illusie","Waarom verschillen GPU-aantallen per megawatt? Lees hoe PUE, piekbelasting, opslag, netwerken en koeling de inzetbare AI-capaciteit bepalen.","2026-07-27T23:52:00","ai-data-center-power-requirements-gpu-per-megawatt","\u002Fasset\u002Fimages\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt\u002Fgpu-per-megawatt-illusion.webp",[856,857,858,859,860,861],"Alle","AI-infrastructuur","Datacenters","ModFlex","HPC","AMD Helios",{"path":863,"title":864,"description":865,"date":866,"slug":867,"image":868,"originalUrl":869,"categories":870},"\u002Fblog\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","Wan2.2-videogeneratie: Paiton op AMD MI355X","Vergelijk Wan2.2-videogeneratie op AMD MI355X met Paiton en NVIDIA B200 via Diffusers. Lees hoe we diffusiemodellen optimaliseren.","2026-06-10T14:04:04","paiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonwan2.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x\u002F",[856,770,769,871,872,873,874,875,876,877,878,879,121,880,881,882,883,884,885,886,769,887,888,889,890,891,892],"14B","AMD","B200","Benchmarks","Blackwell","Compute","Diffusie","Eliovp","Generatieve AI","Hardware","Inferentie","Instinct","MI355x","NVIDIA","On-premises","Optimalisatie","Soevereine AI","T2V","Tekst-naar-video","Tuning","Video-generatie","Wan2.2",{"path":894,"title":895,"description":896,"date":897,"slug":898,"image":899,"originalUrl":900,"categories":901},"\u002Fblog\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","ElioVP in De Tijd: chipoptimalisatie en datacenters","Lees hoe De Tijd ElioVP belicht, van de oorsprong in chipoptimalisatie tot het werk aan modulaire datacenters en koeling voor hoge vermogensdichtheid.","2026-02-10T20:48:12","from-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fphysicalnewspaper.webp","https:\u002F\u002Feliovp.com\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure\u002F",[856,770,902,903,872,904,902,884],"Modulaire DC","Niet gecategoriseerd","De Tijd",{"path":906,"title":907,"description":908,"date":909,"slug":910,"image":911,"originalUrl":912,"categories":913},"\u002Fblog\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","AI en privacy: een strategische prioriteit in de Benelux","Privacyrisico's van generatieve AI, vertrouwen, dataopslag en governance. Waarom bedrijven in de Benelux veilige AI strategisch moeten benaderen.","2026-01-29T13:51:11","privacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fheaderimage.webp","https:\u002F\u002Feliovp.com\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit\u002F",[856,770,914,903,915,916,917,918,919,920,921,922,878,923,879,924,925,926],"Trending","AI Act","Antropomorfisme","AVG","Benelux","ChatGPT","Cyberbeveiliging","Databeheer","Gegevensbeveiliging","GDPR","Microsoft Copilot","Privacy","Shadow AI",{"path":928,"title":929,"description":930,"date":931,"slug":932,"image":933,"originalUrl":934,"categories":935},"\u002Fblog\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","Waarom wij itsme niet gebruiken: privacy en soevereiniteit","Waarom ElioVP itsme niet gebruikt: onze afwegingen rond identiteitsmetadata, cloudafhankelijkheid, privacy en datasoevereiniteit.","2025-11-27T09:32:14","itsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontimage.webp","https:\u002F\u002Feliovp.com\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom\u002F",[856,936,937,938,920,939,940,941,923,942,943,944,925],"AWS","Belgian Mobile ID","CLOUD Act","Datasoevereiniteit","Digitale identiteit","eIDAS","itsme","Liberty Global","MyGov.be",{"path":946,"title":947,"description":948,"date":949,"slug":950,"image":951,"originalUrl":952,"categories":953},"\u002Fblog\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025","Praktijkrapport: de realiteit van Agentic AI bouwen in 2025","Praktijklessen over lokale AI-agents in 2025 gaan in op workflowontwerp, observability, modeltraining, hallucinaties en GPU-geheugenlimieten.","2025-11-25T14:03:39","field-report-the-reality-of-building-agentic-ai-in-2025","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffieldreport.webp","https:\u002F\u002Feliovp.com\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025\u002F",[856,770,954,914,955,956,957,958,959,960,961,962,887,963],"Oplossingen","Agentic AI","AI-techniek","AI-strategie","Autonome agenten","Bedrijfs-AI","Lokale LLM","Modelverfijning","AI op locatie","VRAM-optimalisatie",{"path":965,"title":966,"description":967,"date":968,"slug":969,"image":970,"originalUrl":971,"categories":972},"\u002Fblog\u002Fthe-synthetic-unicorn-bubble","De synthetische unicornzeepbel","Een analyse van investeringsrisico’s bij AI-neoclouds: circulaire financiering, infrastructuurclaims, contractvoorwaarden en due diligence.","2025-11-24T19:22:28","the-synthetic-unicorn-bubble","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsyntheticunicorn.webp","https:\u002F\u002Feliovp.com\u002Fthe-synthetic-unicorn-bubble\u002F",[856,770,914,973,974,975,976,977,978,979,980,981,982],"AI Infrastructure","AI Neocloud","Circulaire financiering","GPU Cloud","Beleggingsrisico's","Opstartwaardering","Synthetische bubbel","Technische analyse","Vaporware","Durfkapitaal",{"path":984,"title":985,"description":986,"date":987,"slug":988,"image":989,"originalUrl":990,"categories":991},"\u002Fblog\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","NVIDIA GB300 NVL72: modulair datacenter in vier maanden","Ontdek een modulair datacenterontwerp voor NVIDIA GB300 NVL72, met redundante voeding, hybride koeling en een bouwplanning van vier maanden.","2025-11-20T14:10:19","building-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsuperpodmodflexfrontimage.webp","https:\u002F\u002Feliovp.com\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power\u002F",[856,902,903,992,857,993,994,995,996,997,998,999,1000],"150 kW-rack","DLC","Hoge dichtheid","Vloeistofkoeling","Modulair datacenter","NVIDIA Blackwell Ultra","NVIDIA GB300","NVL72","Snelle implementatie",{"path":1002,"title":1003,"description":1004,"date":1005,"slug":1006,"image":1007,"originalUrl":1008,"categories":1009},"\u002Fblog\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential","CUDA-vertaling versus AMD-gerichte optimalisatie","Waarom CUDA-compatibiliteit niet hetzelfde is als AMD-prestaties: over ROCm, HIP, kerneloptimalisatie en hardwaregerichte afstemming.","2025-11-12T14:48:37","why-cuda-translation-wont-unlock-amds-real-potential","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fchatgpt-image-nov-11-2025-09_16_10-pm-1.webp","https:\u002F\u002Feliovp.com\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential\u002F",[856,770,769,903,1010,770,1011,1012,1013,1014,1015,1016,769,662],"AMD MI300X","CUDA-vertaling","FP8","GPU-optimalisatie","High-performance computing","HIP","Kerneltuning",{"path":1018,"title":1019,"description":1020,"date":1021,"slug":1022,"image":1023,"originalUrl":1024,"categories":1025},"\u002Fblog\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference","Paiton: snellere AI-inferentie in uw bestaande stack","Lees hoe Paiton aansluit op bestaande inferentiestacks, met AMD MI300X-benchmarks en vergelijkingen van prestaties per dollar.","2025-11-11T10:31:22","paiton-the-simplest-way-to-supercharge-ai-inference","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton-powaaah.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference\u002F",[856,770,769,772,1026,1010,778,1027,775,1016,769,1028,777],"AMD Instinct","Hoge throughput","SGLang",{"path":1030,"title":1031,"description":1032,"date":1033,"slug":1034,"image":1035,"originalUrl":1036,"categories":1037},"\u002Fblog\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","Paiton MoE-benchmarks: MI300X versus H200 en B200","Vergelijk Qwen3-30B-A3B MoE-benchmarks van MI300X met Paiton, H200 en B200: throughput en kosten per miljoen tokens.","2025-09-26T13:36:18","stop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhulkvshulkpaitonwins.webp","https:\u002F\u002Feliovp.com\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens\u002F",[856,770,769,1038,1010,1039,775,1040,1041,1042,1043,769,1044],"AI-benchmarks","Kosten per token","Mixture of Experts","MoE","NVIDIA B200","NVIDIA H200","Qwen3",{"path":1046,"title":1047,"description":1048,"date":1049,"slug":1050,"image":1051,"originalUrl":1052,"categories":1053},"\u002Fblog\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","Lokale Agentic AI: van inbox naar actie","Lokale AI-agents zetten e-mails, documenten en beelden om in tickets, rapporten en acties, met modellen op maat van uw gegevens en systemen.","2025-09-16T13:09:00","agentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontfotoblog.webp","https:\u002F\u002Feliovp.com\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en\u002F",[856,770,954,903,955,1054,1055,1056,1057,960,962,887,1058,1059],"Schadedetectie","Documentverwerking","E-mailautomatisering","Factuurextractie","Ticketautomatisering","Workflowautomatisering",{"path":1061,"title":1062,"description":1063,"date":1064,"slug":1065,"image":1066,"originalUrl":1067,"categories":1068},"\u002Fblog\u002Fmi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","MI300X FP8-benchmarks: GPU-partitionering met Paiton","Bekijk hoe Paiton presteert met Llama 3.1 8B FP8 op gepartitioneerde MI300X-GPU's, vergeleken met NVIDIA H200 en B200.","2025-07-31T13:32:57","mi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fimage-2-1.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-fp8-data%e2%80%91parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach\u002F",[856,770,769,903,1069,872,873,1070,1071,883,884,769,777],"AI","H200","MI300X",{"path":1073,"title":1074,"description":1075,"date":1076,"slug":1077,"image":1078,"originalUrl":1079,"categories":1080},"\u002Fblog\u002Fapplicable-ai-for-businesses","Toepasbare AI voor bedrijven","Ontdek hoe ElioVP lokale AI voor bedrijfsprocessen bouwt, met modeltraining op maat en automatische schadedetectie voor de logistiek.","2025-07-09T21:35:30","applicable-ai-for-businesses","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fscherm_afbeelding-2025-07-09-om-23.30.17.webp","https:\u002F\u002Feliovp.com\u002Fapplicable-ai-for-businesses\u002F",[856,770,954,955,1054,1055,1056,1057,960,962,887,1058,1059],{"path":1082,"title":1083,"description":1084,"date":1085,"slug":1086,"image":522,"originalUrl":1087,"categories":1088},"\u002Fblog\u002Fintroducing-paitons-free-evaluation-models","Maak kennis met de gratis evaluatiemodellen van Paiton","Test Paiton met gratis evaluatiemodellen voor AMD-GPU's. Vergelijk de prestaties voor tekst, beeldanalyse en beeldgeneratie met uw eigen workloads.","2025-07-07T11:26:13","introducing-paitons-free-evaluation-models","https:\u002F\u002Feliovp.com\u002Fintroducing-paitons-free-evaluation-models\u002F",[856,770,769],{"path":1090,"title":1091,"description":1092,"date":1093,"slug":1094,"image":1095,"originalUrl":1096,"categories":1097},"\u002Fblog\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","Llama 3.1 405B: sneller starten met Paiton op MI300X","Bekijk Paiton-benchmarks voor Llama 3.1 405B op acht AMD MI300X-GPU's, met opstarttijd, tensorparallelisme, throughput en latency.","2025-06-12T20:15:23","paiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fservingscreenshot.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b\u002F",[856,770,769,903,772,1010,1098,1012,1099,1100,1101,769,1102,1103],"Koude start","Grafiekcompilatie","Llama 3.1 405B","LLM-optimalisatie","Opstartlatentie","Tensor-parallellisme",{"path":1105,"title":1106,"description":1107,"date":1108,"slug":1109,"image":1110,"originalUrl":1111,"categories":1112},"\u002Fblog\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x","Paiton FP8 verslaat NVIDIA's H200 op AMD's MI300X","Vergelijk Paiton op AMD MI300X met NVIDIA H200 voor Llama 3.1 70B FP8: throughput, wachttijd tot het eerste token en latency bij diverse batchgroottes.","2025-06-08T19:12:40","paiton-fp8-beats-nvidias-h200-on-amds-mi300x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fblognewfp8.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x\u002F",[856,770,769,903,1010,1113,959,879,773,774,776,1100,1114,1115],"Koude startoptimalisatie","Model serving","vLLM-optimalisatie",{"path":1117,"title":1118,"description":1119,"date":1120,"slug":1121,"image":1122,"originalUrl":1123,"categories":1124},"\u002Fblog\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","MI300X, H200, RX 7900 XTX en n300s: vLLM-benchmarks","Vergelijk MI300X, H200, RX 7900 XTX en Tenstorrent n300s met vLLM: throughput, gemodelleerde tokenkosten en hardwarebeperkingen voor Llama 3 8B.","2025-05-09T14:03:58","mi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisontenstor.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm\u002F",[856,770,769,954,903,872,1071,884,1125,1126],"RX7900XTX","tenstorrent",{"path":1128,"title":1129,"description":1130,"date":1131,"slug":1132,"image":1133,"originalUrl":1134,"categories":1135},"\u002Fblog\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","ClusterP&L: financiële modellen voor GPU-clusters","Ontdek hoe ClusterP&L kosten, rendement en investeringsscenario's voor GPU-clusters modelleert, met risicoanalyses en exporteerbare rapporten.","2025-05-03T10:52:22","clusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisonscenarios.webp","https:\u002F\u002Feliovp.com\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights\u002F",[856,770,902,954,873,1070,1136,884,1137],"MI325X","P&L-calculator",{"path":1139,"title":1140,"description":1141,"date":1142,"slug":1143,"image":1144,"originalUrl":1145,"categories":1146},"\u002Fblog\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","AMD MI300X versus NVIDIA H200: Qwen3-32B met Paiton","Vergelijk Qwen3-32B-benchmarks op AMD MI300X met Paiton en NVIDIA H200, met resultaten voor throughput, latency en hardwarekosten.","2025-05-02T21:10:30","cranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002F3ac59a73-2466-4422-b7e5-ef2e4a8ca58e.webp","https:\u002F\u002Feliovp.com\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200\u002F",[856,770,769,1069,872,1070,1147,884,769,777],"MI300",{"path":1149,"title":1150,"description":1151,"date":1152,"slug":1153,"image":1154,"originalUrl":1155,"categories":1156},"\u002Fblog\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","Modulaire datacenters voor NVIDIA NVL: 1 tot 2 MW","Ontdek modulaire datacenterontwerpen voor NVIDIA NVL-systemen, met aandacht voor vermogen, vloeistofkoeling, redundantie en uitrolplanning.","2025-05-02T14:09:59","power-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Feliovp_critical-1mw-pod_rev-2_transparent.webp","https:\u002F\u002Feliovp.com\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw\u002F",[856,902,1157,973,994,860,995,996,1158,1159,999,1160],"1-2MW datacenter","NVIDIA Blackwell","NVIDIA NVL","Precisiekoeling",{"path":1162,"title":1163,"description":1164,"date":1165,"slug":1166,"image":1167,"originalUrl":1168,"categories":1169},"\u002Fblog\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","AI-agents in de medische wereld: AI die DICOM spreekt","Ontdek een lokale AI-agent die DICOM-gegevens opzoekt en bekijk tests van beeldmodellen met geanonimiseerde medische beelden.","2025-04-11T14:45:48","examining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhealthcareblog-1.webp","https:\u002F\u002Feliovp.com\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom\u002F",[856,770,954,903,1069,872,1170],"Zorg",{"path":1172,"title":1173,"description":1174,"date":1175,"slug":1176,"image":1177,"originalUrl":1178,"categories":1179},"\u002Fblog\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","Amerikaanse invoerheffingen en AI-leveringszekerheid in 2025","Lees ElioVP's visie uit april 2025 op Amerikaanse invoerheffingen en leveringszekerheid voor AI-servers, HPC-systemen en modulaire datacenters.","2025-04-04T10:01:27","eliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftariffsshipping.webp","https:\u002F\u002Feliovp.com\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs\u002F",[856,914,1069,872,1180,1181,1182,1183],"Invoer","Taiwan","Invoerheffingen","Trump",{"path":1185,"title":1186,"description":1187,"date":1188,"slug":1189,"image":1190,"originalUrl":1191,"categories":1192},"\u002Fblog\u002Fwhy-ai-agents-are-the-future","Waarom AI-agenten de toekomst zijn","Ontdek AI-agents voor ERP, CRM, financiën en klantondersteuning, met praktijkvoorbeelden en een traject van procesanalyse tot pilot en uitrol.","2025-03-23T22:06:59","why-ai-agents-are-the-future","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ferp2.jpeg","https:\u002F\u002Feliovp.com\u002Fwhy-ai-agents-are-the-future\u002F",[856,770,954,1069,1193,1194],"AI-agenten","ERP",{"path":1196,"title":1197,"description":1198,"date":1199,"slug":1200,"image":1201,"originalUrl":1202,"categories":1203},"\u002Fblog\u002Fthe-rise-of-open-source-ai-model-optimization","De opkomst van open-source AI-modeloptimalisatie","Verken trends in opensource-AI-optimalisatie: kwantisatie, mixture-of-experts-modellen, hardwaregerichte afstemming, RAG en edge-AI.","2025-03-22T20:59:23","the-rise-of-open-source-ai-model-optimization","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Friseofopensource.jpeg","https:\u002F\u002Feliovp.com\u002Fthe-rise-of-open-source-ai-model-optimization\u002F",[856,770,914,1204,872,121,884],"AI-nieuws",{"path":1206,"title":1207,"description":1208,"date":1209,"slug":1210,"image":1211,"originalUrl":1212,"categories":1213},"\u002Fblog\u002Fintroducing-our-benchmarking-tool-powered-by-dstack","Maak kennis met onze benchmarktool, gebouwd op dstack","Ontdek onze benchmarktool met dstack: herhaalbare vLLM-tests, automatische parameterreeksen en prestatierapporten voor lokale GPU's en de cloud.","2025-03-20T14:21:59","introducing-our-benchmarking-tool-powered-by-dstack","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fbenchmarktool.jpeg","https:\u002F\u002Feliovp.com\u002Fintroducing-our-benchmarking-tool-powered-by-dstack\u002F",[856,770,769,1069,872,1214,1215,1071,769],"benchmark","LLM",{"path":1217,"title":1218,"description":1219,"date":1220,"slug":1221,"image":1222,"originalUrl":1223,"categories":1224},"\u002Fblog\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","QwQ-32B optimaliseren (door Qwen): AMD MI300X versus NVIDIA H200","Vergelijk throughput en latency van QwQ-32B op AMD MI300X met Paiton en NVIDIA H200, bij kleine batches en meer gelijktijdige aanvragen.","2025-03-19T21:41:44","optimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton4.jpeg","https:\u002F\u002Feliovp.com\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200\u002F",[856,770,769],{"path":1226,"title":1227,"description":1228,"date":1229,"slug":1230,"image":1231,"originalUrl":1232,"categories":1233},"\u002Fblog\u002Feliovp-featured-on-amd-tech-talk-podcast","Eliovp te gast in de AMD Tech Talk-podcast","Beluister Elio Van Puyvelde en Jim Greene in de AMD Tech Talk-podcast over het ontstaan van ElioVP en de hardware- en softwarediensten voor AI.","2025-03-19T07:53:39","eliovp-featured-on-amd-tech-talk-podcast","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftechtalkjimgreene.jpeg","https:\u002F\u002Feliovp.com\u002Feliovp-featured-on-amd-tech-talk-podcast\u002F",[856,872,1234,1235,1236],"Jim Greene","Podcast","Tech Talk",{"path":1238,"title":1239,"description":1240,"date":1241,"slug":1242,"image":1243,"originalUrl":1244,"categories":1245},"\u002Fblog\u002Ffurther-optimizing-amd-powered-inference-with-paiton","AMD-inferentie verder optimaliseren met Paiton","Bekijk Paiton-benchmarks voor DeepSeek R1 Distill Llama 8B op AMD MI300X, gericht op throughput en latency bij kleinere batchgroottes.","2025-03-13T06:18:30","further-optimizing-amd-powered-inference-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost3.webp","https:\u002F\u002Feliovp.com\u002Ffurther-optimizing-amd-powered-inference-with-paiton\u002F",[856,770,769,872,1246,1247,1070,1071,1136,769,777],"DeepSeek","H100",{"path":1249,"title":1250,"description":1251,"date":1252,"slug":1253,"image":1254,"originalUrl":1255,"categories":1256},"\u002Fblog\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","Paiton-benchmarks: DeepSeek R1 Distill Llama 3.1 8B","Vergelijk standaard- en Paiton-versies van DeepSeek R1 Distill Llama 3.1 8B op AMD MI300X, met benchmarks voor throughput en latency.","2025-01-31T09:11:02","a-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost2.webp","https:\u002F\u002Feliovp.com\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b\u002F",[856,770,769,872,1246,1247,1070,1071,1136,769,777],{"path":1258,"title":1259,"description":1260,"date":1261,"slug":1262,"image":1263,"originalUrl":1264,"categories":1265},"\u002Fblog\u002Fai-model-optimization-with-paiton","AI-modeloptimalisatie met Paiton","Lees hoe Paiton modelcompilatie, aangepaste kernels en kernelfusie inzet om AI-inferentie op AMD GPU's te optimaliseren.","2025-01-30T19:53:25","ai-model-optimization-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost1.webp","https:\u002F\u002Feliovp.com\u002Fai-model-optimization-with-paiton\u002F",[856,770,769,872,1247,1070,1071,1136,769,777],1789853167812]