
#OpenAIInferenceCostTest
About OpenAIInferenceCostTest
OpenAI shared early tests of Jalapeño, its first in-house inference chip. It says it delivers 1.5x-1.9x more throughput per watt on open models and cuts end-to-end latency by 1.7x-3.6x. Deployment is planned by year-end, with two successors in development. It also says GPT-5.6 Sol used 54% fewer output tokens than a leading rival on coding tasks. After $6.7B in Q2 revenue and a $12.3B operating loss, can these company-tested gains lower inference costs, narrow losses and support its IPO valuatio
Populare
Cele mai recente
OpenAIInferenceCostTest Postări populare
#OpenAIQ2LossWidens
Companiile cu creștere rapidă nu devin întotdeauna afaceri grozave.
OpenAI continuă să crească, dar și pierderile cresc. Anthropic urmează o cale diferită, arătând semne timpurii de profitabilitate. Veniturile câștigă titluri.
Economia sustenabilă decide de obicei cine câștigă maratonul. Ce contează mai mult pentru tine astăzi, creșterea sau profitabilitatea?

RECENT IN: Șansele ca Anthropic să fie IPO peste creșterea evaluării de $SPCX de 1,77 trilioane de dolari a SpaceX.

Toată atenția din jurul lui Jalapeño pare concentrată pe performanță față de Nvidia, dar viteza inginerească din spatele acestuia este cu adevărat remarcabilă. Câteva momente importante din prezentarea @hotchipsorg:
1. Construirea cipurilor personalizate necesita anterior armate masive de ingineri și termene temporare pe mai mulți ani. OpenAI a trecut de la codul RTL inițial la tapeout în doar 9 luni, folosind XLS (un limbaj asemănător Rust pentru hardware-uri de la Google) și co-design condus de AI.
2. O buclă AI a luat un nucleu brut, abia funcțional (DeepSeek), care rula cu o eficiență de 0,31%, și l-a optimizat autonom până la 88,94% din limita fizică a cipului în mai puțin de 2 zile.
3. Codul generat de AI rula de până la 1,8 ori mai rapid pe blocuri critice decât implementările reglate manual de ingineri de kernel de clasă mondială.
4. AI a făcut mai mult decât să scrie software pentru cip. A optimizat circuitele hardware fizice înainte de tapeout.
Din nou, acest lucru nu este o sumă zero sau un negativ net pentru Nvidia. ASIC-urile personalizate deblochează eficiențe absurde de servire pentru sarcini specializate și vor extinde întreaga piață de calcul pentru întreaga industrie.
De când am anunțat Jalapeño, primul nostru cip de inferență personalizat, l-am testat pe acesta și sistemul din jurul său.
Rezultatele arată un progres major: mai multă inteligență din fiecare watt și răspunsuri mai rapide, oferind atât un debit mai mare, cât și o latență mai mică într-o singură arhitectură, fără a sacrifica eficiența.

OpenAI spune că noul său cip AI Jalapeño ar putea reduce semnificativ costurile de rulare a inteligenței artificiale, dar Jim Cramer (@jimcramer) rămâne sceptic că reprezintă o amenințare serioasă pentru Nvidia ($NVDA).
Jalapeño este primul cip de inferență personalizată al OpenAI și a fost dezvoltat împreună cu Broadcom ($AVGO). Compania intenționează să înceapă implementarea acestuia intern până la sfârșitul anului 2026, iar producția va crește și mai mult în 2027.
CEO-ul OpenAI, Sam Altman (@sama), a descris cipul pur și simplu spunând: "Am creat un cip și este rapid." Compania lucrează deja la versiunile de a doua și a treia generație.
OpenAI spune că Jalapeño poate oferi atât un throughput mai mare, cât și o latență mai mică, o combinație dificil de realizat. Benchmark-urile interne au arătat performanțe pe watt mai bune decât sistemele GB200 și GB300 ale Nvidia pe mai multe modele mari de AI.
În funcție de volumul de lucru, OpenAI susține că Jalapeño a oferit aproximativ de 1,5 până la 1,9x mai multă performanță pe watt și o latență semnificativ mai mică. Cipul este proiectat special pentru inferență, nu pentru antrenament AI.
Directorul hardware OpenAI, Richard Ho, a spus că aceste câștiguri de eficiență s-ar putea traduce în cele din urmă prin prețuri mai mici pentru tokenuri pentru clienți, pe măsură ce cipul intră în producție.
Totuși, OpenAI nu intenționează să înlocuiască complet Nvidia. Compania a anunțat că va continua să folosească acceleratoare Nvidia și hardware de la alți parteneri atât pentru instruire, cât și pentru inferență.
Cramer a respins ideea că fiecare nou cip AI reprezintă un challenger semnificativ pentru Nvidia. El a spus că aude frecvent afirmații despre cipuri superioare, dar continuă să nu vadă "concurenți reali" pentru Nvidia la scară largă.


Jalapeno de la OpenAI este un semnal că industria AI intră în era "deține stack-ul".
Playbook-ul era să rămâi pe linia ta și să te concentrezi.
Companiile model au antrenat modele. Companiile de cipuri au produs cipuri. Companiile de date colectau date.
Acea eră s-a terminat.
OpenAI a început ca un laborator de modele pur. Acum proiectează siliciu personalizat și optimizează sistemele complete în funcție de sarcinile lor reale.
Săptămâna aceasta am văzut, de asemenea, @Figure_robot trecând în stratul de date și lansând Index, propriile lor eforturi de colectare a datelor care acoperă 108 țări.
Toată lumea se mișcă în sus și în jos pe stivă.
O parte probabil este pentru a adânci șanțurile subțiri, o parte pentru a reduce costurile, o parte pentru a justifica evaluările.

OpenAI a construit un cip de inferență personalizat (Jalapeño) și a trecut de la primul RTL la tapeout în 9 luni.
Când proiectam și bandajam SoC-uri complexe, 18–24 de luni de la RTL până la tapeout era normal. Verificarea și proiectarea fizică consumau cea mai mare parte a programului.
Scrierea AI în Verilog/VHDL este oarecum de așteptat cu toți agenții de programare. Partea impresionantă a fost... echipa @OpenAI folosit un model intern cu feedback QoR rapid și verificare robustă pentru a optimiza RTL-ul
AI comprimă cu adevărat ciclul de proiectare... bine pentru toată lumea. Am vedea mai mult siliciu și mai multă inovație. Acum diferențierea se mută spre asigurarea capacității TSMC și alocarea HBM...
Se pot proiecta mai multe cipuri... dar mai puține pot fi produse la scară largă.



OpenAI ia în serios deținerea întregului stack AI
Jalapeño trece în sfârșit de la testare la infrastructura OpenAI
> mai multă muncă AI de la fiecare watt
> un debit mai mare cu latență mai mică
> răspunsuri mai rapide ChatGPT și Codex
aceasta este doar Gen 1, Gen 2 este deja în dezvoltare, în timp ce Gen 3 prinde contur.
OpenAI are deja modelele, utilizatorii și cererea.
Acum construiește și calculul de sub ele.
întrebarea reală este cât de departe merge acest lucru când Jalapeño începe să scaleze infrastructura lor.
cum crezi că va arăta Gen 2?


De când am anunțat Jalapeño, primul nostru cip de inferență personalizat, l-am testat pe acesta și sistemul din jurul său.
Rezultatele arată un progres major: mai multă inteligență din fiecare watt și răspunsuri mai rapide, oferind atât un debit mai mare, cât și o latență mai mică într-o singură arhitectură, fără a sacrifica eficiența.
Testele timpurii Jalapeño ale OpenAI indică o schimbare potențial semnificativă în economia inferenței: 1,5x-1,9x mai mult debit pe watt și 1,7x-3,6x latență end-to-end mai mică pe modelele deschise. GPT-5.6 Sol a folosit, de asemenea, cu 54% mai puține tokenuri de ieșire decât un rival de top la sarcinile de programare.
Judecata măsurată este că câștigurile de eficiență ar putea îmbunătăți economia unităților, dar reperele testate de companii nu sunt încă dovada unor costuri agregate mai mici. Cu 6,7 miliarde de dolari în venituri din trimestrul al doilea față de o pierdere operațională de 12,3 miliarde de dolari, implementarea la scară largă și creșterea volumului de muncă vor conta mai mult decât performanța generală. Nu este un sfat, ci doar o analiză.
#OpenAIInferenceCostTest

Primul cip de inferență personalizat al OpenAI oferă un randament mai mare, latență mai mică și eficiență mai bună într-o singură arhitectură.
Când cel mai mare laborator AI începe să-și proiecteze propriul siliciu, economia inferenței la scară largă are o problemă.
Stratul de calcul este reconstruit de la zero.
De când am anunțat Jalapeño, primul nostru cip de inferență personalizat, l-am testat pe acesta și sistemul din jurul său.
Rezultatele arată un progres major: mai multă inteligență din fiecare watt și răspunsuri mai rapide, oferind atât un debit mai mare, cât și o latență mai mică într-o singură arhitectură, fără a sacrifica eficiența.


