#OpenAIInferenceCostTest

Переглядають: 653,3 тис.|Публікацій: 213

About OpenAIInferenceCostTest

OpenAI shared early tests of Jalapeño, its first in-house inference chip. It says it delivers 1.5x-1.9x more throughput per watt on open models and cuts end-to-end latency by 1.7x-3.6x. Deployment is planned by year-end, with two successors in development. It also says GPT-5.6 Sol used 54% fewer output tokens than a leading rival on coding tasks. After $6.7B in Q2 revenue and a $12.3B operating loss, can these company-tested gains lower inference costs, narrow losses and support its IPO valuatio

OpenAIInferenceCostTest Популярні дописи

TBNG_OKX
TBNG_OKX
#OpenAIQ2LossWidens Швидкозростаючі компанії не завжди стають чудовими бізнесами. OpenAI продовжує зростати, але збитки теж зростають. Anthropic йде іншим шляхом, демонструючи ранні ознаки прибутковості. Дохід привертає увагу в заголовках. Стійка економіка зазвичай визначає, хто переможе марафон. Що для вас важливіше сьогодні — зростання чи прибутковість?
Watcher_Guru
Watcher_Guru
ЩОЙНО: Ймовірність IPO Anthropic перевищує $SPCX стрибок оцінки SpaceX на $1,77 трильйона.
anand iyer
anand iyer
Вся увага навколо Jalapeño зосереджена на продуктивності порівняно з Nvidia, але інженерна швидкість справді вражає. Деякі основні моменти з @hotchipsorg доповіді: 1. Створення кастомних чипів, що вимагало величезних армій інженерів і багаторічних термінів. OpenAI перейшов від початкового RTL-коду до завершення всього за 9 місяців, використавши XLS (мову, схожу на Rust для хартування від Google) та спільний дизайн на основі штучного інтелекту. 2. AI-цикл взяв сирий, ледь функціональний (DeepSeek) ядро з ефективністю 0,31% і автономно оптимізував його до 88,94% фізичного ліміту чипа менш ніж за 2 дні. 3. Код, створений ШІ, працював до 1,8 рази швидше на критичних блоках, ніж реалізації, налаштовані вручну інженерами світового рівня ядра. 4. ШІ робив більше, ніж просто писав програмне забезпечення для чипа. Він оптимізував фізичні апаратні схеми перед виходом на tapeout. Знову ж таки, це не нульова сума і не чистий негатив для Nvidia. Кастомні ASIC відкривають абсурдну ефективність обслуговування для спеціалізованих завдань і розширюють загальний обчислювальний обсяг для всієї галузі.
OpenAI
OpenAI
Після анонсу Jalapeño, нашого першого індивідуального інференційного чипа, ми тестували його та систему навколо нього. Результати свідчать про значний прогрес: більше інтелекту з кожного ват і швидші відгуки, що забезпечує як вищу пропускну здатність, так і нижчу затримку в одній архітектурі без втрати ефективності.
ℏεsam
ℏεsam
OpenAI використала штучний інтелект (моделі Sol та Astra) для допомоги у розробці чипів Jalapeño, які працюватимуть з AI.
Benzinga
Benzinga
OpenAI заявляє, що її новий чіп Jalapeño AI може суттєво знизити вартість роботи штучного інтелекту, але Джим Крамер (@jimcramer) залишається скептично налаштованим, що він становить серйозну загрозу для Nvidia ($NVDA). Jalapeño — це перший власний інференційний чіп OpenAI, розроблений разом із Broadcom ($AVGO). Компанія планує розпочати його внутрішнє впровадження до кінця 2026 року, а виробництво очікується подальше зростання у 2027 році. Генеральний директор OpenAI Сем Олтман (@sama) описав чіп просто: «Ми зробили чіп, і він дуже швидкий.» Компанія вже працює над версіями другого та третього покоління. OpenAI стверджує, що Jalapeño може забезпечити як вищу пропускну здатність, так і нижчу затримку — поєднання, яке досягти складно. Її внутрішні бенчмарки показали кращу продуктивність на ват, ніж системи Nvidia GB200 та GB300 на кількох великих моделях штучного інтелекту. Залежно від навантаження, OpenAI стверджує, що Jalapeño забезпечував приблизно в 1,5–1,9 рази більше продуктивності на ватт і значно нижчу затримку. Чіп розроблений спеціально для інференції, а не для навчання ШІ. Керівник апаратного забезпечення OpenAI Річард Хо заявив, що ці підвищення ефективності можуть зрештою призвести до зниження цін на токени для клієнтів у міру масштабування чипа у виробництво. Проте OpenAI не планує повністю замінити Nvidia. Компанія заявила, що продовжить використовувати прискорювачі Nvidia та апаратне забезпечення від інших партнерів як для навчання, так і для висновків. Крамер відкинув ідею, що кожен новий чіп на основі штучного інтелекту є значущим суперником Nvidia. Він сказав, що регулярно чує заяви про кращі чипи, але все ще не бачить «реальних конкурентів» Nvidia у масштабі.
LJW
LJW
Халапеньо від OpenAI — це сигнал того, що індустрія ШІ вступає в еру «володіння стеком». Раніше плейбук був зосереджений на своїй дорозі і зосереджений. Компанії з моделей навчали моделей. Компанії з виробництва чипів виготовляли чипи. Компанії з обробки даних збирали дані. Ця епоха минула. OpenAI починався як чиста лабораторія моделей. Зараз вони розробляють кастомний кремній і оптимізують повні системи під свої реальні робочі навантаження. Цього тижня ми також побачили, як @Figure_robot перейшли на рівень даних і запустили Index — власну ініціативу зі збору даних, що охоплює 108 країн. Всі рухаються вгору і вниз по стопці. Частково, ймовірно, зроблено для поглиблення вузьких ровів, частково — для зниження витрат, частково — для виправдання оцінки.
Baris
Baris
OpenAI створила власний чіп виведення (Jalapeño) і перейшов від першого RTL до tapeout за 9 місяців. Коли я проектував і обробляв складні SoC, 18–24 місяці від RTL до tapeout були нормою. Верифікація та фізичне проєктування займали більшість цього графіка. Написання ШІ для Verilog/VHDL — це очікувано з усіма агентами кодування. Вражаюче було те, що @OpenAI команда використала внутрішню модель з швидким зворотним зв'язком якості якості та надійною перевіркою для оптимізації RTL ШІ справді стискає цикл дизайну... Добре для всіх. Ми побачимо більше кремнію та більше інновацій. Тепер диференціація переходить до забезпечення потужностей TSMC і розподілу HBM... Можна спроектувати більше чіпів... Але у великих масштабах можна виробляти менше.
MaeveKnows
MaeveKnows
OpenAI серйозно ставиться до володіння всім стеком ШІ Халапеньо нарешті переходить від тестування до інфраструктури OpenAI > більше роботи ШІ з кожного ват > вища пропускна здатність із меншою затримкою > швидші відповіді на ChatGPT і Codex це лише перше покоління, друге покоління вже в розробці, а третє покоління формується. OpenAI вже має моделі, користувачів і попит. Тепер він також будує обчислення під ними. справжнє питання — наскільки далеко це зайде, коли Халапеньйо почне масштабуватися по всій своїй інфраструктурі. Як ви думаєте, як виглядатиме Gen 2?
OpenAI
OpenAI
Після анонсу Jalapeño, нашого першого індивідуального інференційного чипа, ми тестували його та систему навколо нього. Результати свідчать про значний прогрес: більше інтелекту з кожного ват і швидші відгуки, що забезпечує як вищу пропускну здатність, так і нижчу затримку в одній архітектурі без втрати ефективності.
Birdie_OKX
Birdie_OKX
Ранні тести OpenAI на халапеньйо вказують на потенційно значущий зсув в економіці виведення: у 1,5-1,9 раза більша пропускна здатність на ватт і 1,7-3,6 рази нижча затримка від кінця до кінця на відкритих моделях. GPT-5.6 Sol також, за повідомленнями, використовував на 54% менше вихідних токенів, ніж провідний конкурент у виконанні завдань кодування. Виміряна оцінка полягає в тому, що підвищення ефективності може покращити економіку одиниць, але перевірені компаніями бенчмарки ще не є доказом нижчих агрегованих витрат. З $6,7 млрд доходу у другому кварталі проти операційного збитку $12,3 млрд, масштабне впровадження та зростання навантаження матимуть важливіше за загальні результати. Це не поради, а просто аналіз. #OpenAIInferenceCostTest
Raven Protocol 🐦‍⬛
Raven Protocol 🐦‍⬛
Перший кастомний інференційний чип OpenAI забезпечує вищу пропускну здатність, меншу затримку та кращу ефективність в одній архітектури. Коли найбільша лабораторія штучного інтелекту починає розробляти власний кремній, економіка висновків у масштабі стикається з проблемою. Обчислювальний рівень перебудовується з нуля.
OpenAI
OpenAI
Після анонсу Jalapeño, нашого першого індивідуального інференційного чипа, ми тестували його та систему навколо нього. Результати свідчать про значний прогрес: більше інтелекту з кожного ват і швидші відгуки, що забезпечує як вищу пропускну здатність, так і нижчу затримку в одній архітектурі без втрати ефективності.