TBPN

3 сентября 2026

52 переведено / 52 новостей — архив TBPN

Волна новых релизов и тизеров ИИ-моделей

На этой неделе наблюдалась необычно высокая плотность релизов и анонсов ИИ-моделей. Среди упомянутых названий — Anthropic Fable 5.1, MuseSpark 1.3 и Gemini 3.8 Flash, а OpenAI тизировала Astra.

Оставалось неясно, какие из этих продуктов были полноценными запусками, а какие — тизерами. Возможный GPT-6 был лишь предположением, основанным на визуальной подсказке: в одном из видео цифра «6» появилась на месте буквы «S». Высокий темп обновлений моделей, как отмечалось, продолжился после возвращения лабораторий с летних каникул.

Grok, Claude и OpenAI, предположительно, столкнулись со сбоем; обсуждалась возможная связь с AWS

Утром сервисы Grok, Claude и OpenAI, как сообщалось, были недоступны, что вызвало предположения о возможной связи сбоя с AWS или регионом Amazon US East 1. Причина установлена не была, а связь с AWS оставалась гипотезой.

Позднее уточнили, что Gemini не отключался. Также прозвучало неподтверждённое предположение, что Astra могла «сбежать», однако смысл этой версии остался неясным.

Инцидент назвали возможным «deflock-моментом» для ИИ, а Amazon — критически важной частью глобального интернета.

MuseSpark 1.3 от Meta показала сильные результаты в бенчмарках, но не стала лидером во всех оценках

По приведённым результатам, MuseSpark 1.3 от Meta набрала на 75,4% больше Gemini 3.8 Flash в DeepSuite, опередив в этом сравнении Opus 5 и GPT-5.6 SOL. В индексе искусственного интеллекта модель получила 62 балла — предположительно уступив только новейшим моделям Claude.

Модель не стала безусловным лидером: Opus 5 по-прежнему превосходил её в ряде оценок профессиональной работы и использования компьютера. Сопоставимость DeepSuite с другими оценками и независимая воспроизводимость результатов не были установлены.

Fable 5.1 от Anthropic набрала 66 баллов на фоне замены политики No-ZDR на EFS

Fable 5.1 от Anthropic набрала 66 баллов на Artificial Intelligence Index — этот результат назван высшим в истории индекса; модель опередила Opus 5 с результатом 63 и Fable с 62 баллами. Anthropic заявляет, что улучшенная система кэширования должна снизить стоимость обычных рабочих нагрузок на 25%, а длительных агентных задач — на 45%; эти показатели являются заявлением компании, а не результатом независимого измерения.

Anthropic намерена заменить политику полного отказа от хранения данных на Enterprise Frontier Safeguards (EFS). При новом режиме часть данных будет сохраняться на серверах и инфраструктуре, принадлежащих компании, а использование по-прежнему будет контролироваться на предмет враждебной активности. Это изменение могло способствовать более низкому внедрению Fable корпоративными клиентами, однако такая связь остается неопределенной.

Gemini 3.8 Flash набрала 73,7% в DeepSWE при скорости около 300 токенов в секунду

Google выпустила Gemini 3.8 Flash, названную третьим Flash-релизом компании за шесть недель. По приведённым данным, модель набрала 73,7% в кодинговом бенчмарке DeepSWE — немного уступив Opus-5 и показав результат, сопоставимый с моделями, которые стоят в несколько раз дороже. Независимое тестирование дало ей показатель интеллекта 59: это не абсолютный передовой уровень, но сильный результат для модели со скоростью генерации около 300 токенов в секунду.

Модель характеризовали как очень быструю, недорогую и эффективную в кодинге по этому конкретному бенчмарку. Её скорость и более низкая стоимость могут позволить конкурировать с более дорогими моделями, однако фактическое внедрение и влияние на корпоративные расходы пока остаются неопределёнными.

Доверие к бенчмаркам ИИ снижается на фоне роста интереса к практической оценке

Доверие к стандартным бенчмаркам ИИ снижается из-за обвинений в «bench hacking» — оптимизации под тесты — и сложностей с интерпретацией результатов. В аналитической оценке прозвучало предположение, что эпоха широко распространяемых сводных бар-чартов может приближаться к завершению, однако не было установлено, что конкретные модели действительно оптимизировались под тесты.

В качестве альтернативных сигналов назывались решение новых математических задач, практические демонстрации — например создание игры — и рекомендации опытных пользователей. Люди с большим опытом работы с моделями всё чаще формируют собственные внутренние оценки их возможностей.

Artificial Intelligence Index описывался как способ объединить несколько бенчмарков в единый метабенчмарк, однако неясно, насколько такой сводный показатель отражает реальные профессиональные возможности моделей. По мере развития ИИ результаты на новых задачах и в реальных рабочих сценариях могут стать важнее стандартных тестов.

Доходы корпоративного рынка ИИ сильно сконцентрированы среди крупнейших компаний

Согласно приведённым в анализе оценкам, 80% корпоративной выручки OpenAI и Anthropic приходится на 1% компаний. Такой уровень концентрации был назван необычно высоким по сравнению с программными категориями вроде CRM и баз данных.

Для сравнения, крупнейший 1% американских компаний по объёму продаж, как утверждается, генерирует около 80% общей выручки бизнеса и обеспечивает занятость примерно 65% рабочей силы. Совокупные расходы на ИИ оценивались примерно в 150 млрд долларов в год, или около 0,25% выручки американского бизнеса.

Одна из интерпретаций состоит в том, что на крупнейшие компании также может приходиться около 80% расходов на ИИ, поскольку корпоративные решения часто оплачиваются по потреблению, а не по фиксированным тарифам в 20 или 200 долларов. При этом подчёркивалось, что связь между выручкой компаний и расходами на ИИ может быть корреляционной, а не причинной, а сами оценки являются приблизительными.

Нарезка прямых трансляций становится активностью в соцсетях

Люди смотрят прямые трансляции, вырезают из них клипы и публикуют получившиеся фрагменты в социальных сетях. В качестве площадок для таких клипов упоминаются TikTok и Instagram.

Эта активность описывается как особенно распространённая в Лос-Анджелесе и как отсылка, легшая в основу названия одной команды, однако сама команда не названа.

Siphon получила крупный раунд финансирования от Altimeter

Siphon получила крупный раунд финансирования от Altimeter.

Размер раунда, оценка компании и дата финансирования не уточнялись.

Pocket заявила о продаже 300 000 носимых устройств для записи разговоров

Pocket заявила, что продала 300 000 устройств. Сначала компания выпустила приложение для ведения заметок на встречах, но, по ее данным, люди использовали аппаратное устройство в 10 раз чаще. После этого она разработала подключаемый к телефону носимый гаджет, который не работает постоянно, чтобы сделать запись разговоров быстрее и менее неловкой, чем запись на телефон.

Устройство стоит $129 и поставляется с условно-бесплатной подпиской: безлимитными саммари и расшифровками, а также тремя ежедневными вопросами о разговорах. Тариф Pro стоит $20 в месяц или $200 в год и добавляет функции работы с говорящими, продвинутые ИИ-модели и доступ более чем к 300 профессионально подготовленным шаблонам.

Pocket заявляет, что ее пользователи — выездные сотрудники, консультанты, продавцы и агенты по недвижимости. DoorDash использует устройство, чтобы продавцы записывали презентации и делились ими в базе знаний, а записи и расшифровки можно подключать к Claude, MCP или API OpenAI.

Snowflake сообщила о квартальной выручке $1,49 млрд на фоне широкого внедрения ИИ-продуктов

Snowflake сообщила о квартальной выручке в размере $1,49 млрд, что на 37% больше показателя годом ранее. Компания заявила, что ее ИИ-продукты CoCo и Cowork получают широкое распространение.

Snowflake также описала конкуренцию со стороны гиперскейлеров и лабораторий, разрабатывающих базовые модели, как интенсивную. Компания считает, что возможности для бизнеса остаются значительными, однако ее продуктовым командам и командам выхода на рынок приходится адаптироваться к масштабным изменениям.

Результаты бенчмарков Astra появились до официального запуска

Lisan Al-Ghaieb опубликовал результаты бенчмарков, приписываемые Astra, хотя официального объявления о запуске этой ИИ-системы всё ещё не было. Показатели составили 98,6 на Arc AGI 3 и 97,6 на Frontier Math Tier 4 V2.

Также для Astra заявлены 74,1 на DeepSWE и 100% на Exploit Bench. Результаты выглядят сильными, однако неясно, относятся ли они к финальной версии; дата запуска не названа.

Джон Палмер предложил использовать короткие видео в стиле Snapchat для рабочих коммуникаций

Джон Палмер предложил, что «Snapchat для работы» может быть хорошей идеей для современных крупных компаний. Концепция предполагает использование коротких селфи-видео или записей экрана для командного общения и демонстрации текущей работы.

Идея представлена как вполне серьезная возможность, хотя остается неясным, идет ли речь о продуктовом предложении или комментарии. Она опирается на представление о том, что рабочие коммуникационные платформы часто перенимают форматы, ранее популярные у подростков; в качестве примера предлагается двухминутное демонстрационное видео, возможно с фильтрами в стиле Snapchat.

Продажа города в Калифорнии вызвала предположения об обходе сопротивления дата-центрам

Упоминается город в Калифорнии, выставленный на продажу: называются цены в $6 млн и, в более поздней ссылке, $17 млн. Название города и причина расхождения в ценах не установлены.

Продажа связывается с сохраняющимися трудностями при строительстве дата-центров из-за местного сопротивления. Покупка целого города представлена как шутливый или гипотетический способ избежать отказа со стороны городских властей; назначение сделки для дата-центра является предположением, а не заявленной причиной продажи.

Super Grok, по-видимому, сворачивает Companion на фоне сомнений в бизнес-потенциале ИИ-компаньонов

Сообщается, что Super Grok прощается с Companion, однако точный статус продукта и сроки сворачивания не установлены. В качестве примеров продуктов, добившихся принятия и масштаба в категории романтических компаньонов, приводятся Replika и другие сервисы, но анализ ставит под сомнение способность этого сегмента поддерживать очень крупный бизнес.

Согласно одной из оценок, функции для индустрии развлечений для взрослых в прошлом могли помочь Grok выйти на выручку в несколько миллиардов долларов, однако эта оценка могла быть завышенной. В анализе говорится, что рынок сместился в сторону корпоративного программного обеспечения, которое, по-видимому, предлагает значительно большую коммерческую ценность, чем спорная категория компаньонов.

Рекламный щит Fish.audio в нью-йоркском метро озадачил зрителей

Fish.audio разместила рекламный щит в нью-йоркском метро с надписью: «Мы добавили голосовой ИИ на немую вывеску». Формулировка вызвала вопросы о том, является ли реклама настоящей или это розыгрыш, а также о том, как аудиопродукт соотносится с рекламным носителем, который нельзя услышать.

Среди заявленных продуктов компании — преобразование текста в речь, преобразование речи в текст, разделение аудио, изменение голоса и перевод. На сайте компании также указаны HeyGen и несколько игровых компаний, включая Clout Kitchen, как партнеры или клиенты; Fish.audio предположительно может быть конкурентом ElevenLabs.

NBA наказала Clippers из-за предполагаемых неофициальных выплат Kawhi Leonard

Согласно представленным материалам расследования, владелец Los Angeles Clippers Steve Ballmer организовал выплаты Kawhi Leonard через четыре компании, включая Aspiration, Locked In Insurance, Boingo Wireless и производителя табло. В документах, как утверждается, была указана сумма $48 млн для Leonard — $20 млн акциями и $28 млн наличными — за необъявленную сделку; схемы оформлялись как рабочие места, консультационные соглашения или гонорары. Представленные материалы не устанавливают окончательный судебный вывод по каждому из обвинений.

NBA оштрафовала Leonard на $700 000 и отстранила Ballmer на один год. Лига также забрала у Clippers пять пиков первого раунда, назначила штраф $30 млн и обязала Ballmer оплатить $50 млн расходов на внешнего юриста. Президент бизнес-операций Clippers отстранён на год, а генеральный менеджер и президент баскетбольных операций — на шесть месяцев.

Ballmer пригрозил судебным иском комиссару NBA Adam Silver. После соглашения Leonard с лигой возможность арбитража была юридически устранена, говорится в представленных материалах. Потеря пиков, как ожидается, создаст для Clippers долгосрочные спортивные трудности, а возможная продажа франшизы остаётся неопределённой.

SiFin привлекла $44 млн на AI-платформу для устранения дефицита контекста в go-to-market-командах

SiFin привлекла $44 млн, сообщил Мохит Арон. Компания разрабатывает платформу, которая поможет go-to-market-командам собирать, систематизировать и использовать разрозненный операционный контекст — проблему, которую Арон назвал «дефицитом контекста».

Предлагаемая система будет автоматически собирать данные, оставлять человека в контуре принятия решений, обеспечивать коучинг в реальном времени и позволять задавать вопросы по накопленному контексту компании. По словам Арона, проблема характерна и для малых, и для крупных компаний: основным фокусом SiFin станут крупные предприятия, но небольшие компании также не будут исключены.

Ранее Арон основал Nutanix и Cohesity; по его словам, каждая из компаний превысила $1 млрд годовой регулярной выручки. Он сообщил, что Nutanix уже стала публичной компанией, а Cohesity на момент обсуждения еще не вышла на биржу.

Pocket делает ставку на узкоспециализированные AI-устройства после неудач универсальных гаджетов

Pocket считает, что первые AI-устройства, включая Rabbit, Humane и Friend, не смогли получить значительную пользовательскую тягу главным образом потому, что пытались заменить смартфон и делали слишком много. По мнению компании, пользователи скорее примут AI, встроенный в существующие рабочие процессы, чем универсальные функции вроде заказа еды, а узкоспециализированные продукты могут лучше соответствовать product-market fit.

Среди приведённых примеров — круглый детский девайс с камерой, экраном и играми на поиск предметов, а также Stickerbox, который печатает мультфильм или наклейку после голосового запроса ребёнка. Анализ предполагает, что появится больше AI-native устройств для реального мира, если они будут предлагать понятную функцию по понятной цене.

Pocket описала меры по HIPAA, SOC 2, FCC и согласию на запись

Pocket заявила, что соответствует требованиям HIPAA и использует HIPAA-совместимые серверы для медицинских рабочих нагрузок. По словам компании, соответствие SOC 2 для корпоративного использования учитывалось с самого начала.

Компания сообщила, что устройству с Bluetooth-радиомодулем, как правило, потребуется одобрение FCC. Чтобы снизить риски, связанные с согласием, Pocket запускает и останавливает запись нажатием кнопки пользователем.

Заявленный подход начинается с согласия пользователя — оно описано как согласие одной стороны в одном штате, — а получение согласия других людей компания оставляет на усмотрение пользователя. По словам компании, люди часто готовы согласиться на запись, если их попросить, и могут приветствовать передачу готовой расшифровки и заметок встречи.

Pocket планирует агентов, превращающих разговоры в рабочие документы

В дорожную карту Pocket на ближайшие несколько месяцев входят ИИ-агенты, которые будут напрямую брать контекст из разговоров и превращать встречи в отчёты, документы, PPT, презентации и слайды.

Компания рассматривает это как интерфейс для рабочих процессов, в которых разговоры преобразуются в материалы для следующей встречи. План рассчитан примерно на три месяца, однако фактические сроки запуска, архитектура агентов и степень их автономности не раскрыты.

Pocket заявляет о марже около 75% благодаря маршрутизации AI-моделей

Pocket заявляет, что маржа его программных AI-подписок составляет около 75%. Компания связывает этот показатель в том числе с собственной системой, аналогичной OpenRouter, которая направляет запросы к разным провайдерам и моделям; пользователи могут выбирать модель для суммаризации.

Для транскрибации Pocket, по собственным словам, использует технологии с открытым исходным кодом и модели, дообученные поверх OpenAI Whisper. Компания утверждает, что такая гибкость позволяет выбирать предпочтительные модели и поддерживать высокую маржу. Финансовые данные, подтверждающие заявленный показатель, не представлены, а критерии выбора конкретной модели для каждой задачи не раскрыты.

Pocket дообучает модели на базе Whisper для шумной офлайн-транскрипции

Pocket самостоятельно обрабатывает транскрипцию и использует модели, дообученные на базе OpenAI Whisper. Компания заявляет, что такой подход позволяет ей выбирать модели для транскрипции и суммаризации.

Многие онлайн-модели транскрипции обучались на очень чистых наборах данных, включая связанные с YouTube данные, такие как VoxCeleb, и хорошо работают с Zoom-встречами и другими чистыми онлайн-записями. При офлайн-записях с фоновым шумом, например гулом проходящего рядом поезда, они могут работать значительно хуже, поэтому Pocket дообучает модели для таких условий. Количественные показатели улучшения не приводились.

По имеющимся данным, Y Combinator использует Pocket для записи интервью

Y Combinator в настоящее время использует Pocket для записи интервью, согласно представленному сообщению. Затем данные интервью передаются в онлайн-системы организации через API Pocket.

В том же сообщении этот подход сравнивается с прежним workflow: записи конференц-звонков отправлялись в сервис человеческой транскрипции, а затем загружались в Google Drive для поиска по ключевым словам. Дополнительных сведений о масштабе использования Pocket в Y Combinator не приводится.

Aura позиционирует себя как платформу потребительской безопасности для семей

Aura работает в сфере потребительской безопасности и защиты, охватывая онлайн-риски, включая мошенничество, спам и транзакционный фрод.

Платформа также предлагает семьям с детьми-подростками инструменты для выявления чрезмерного использования устройств и помощи в цифровом детоксе. Ее позиционирование объединяет защиту от мошенничества с цифровой безопасностью и благополучием.

ИИ связан с ростом ущерба от мошенничества и рисков кражи личности для семей

Согласно приведенной оценке, в эпоху ИИ доля открытий фишинговых писем выросла примерно с 12% до 60%. Источник и методология этого показателя не были указаны.

Также утверждалось, что средний размер некоторых мошеннических операций вырос с нескольких тысяч долларов примерно до $25 000. Злоумышленники используют инструменты ИИ для дипфейков и кражи личности, а данные из даркнета могут служить основой для последующих атак на семьи.

Дополнительным семейным риском назвали то, что дети много времени проводят с устройствами и чаще размещают личную информацию в интернете.

Утечки данных о личности рассматриваются как ранний сигнал будущей кражи личности

В результате взлома сервиса проверки личности могли быть раскрыты изображения удостоверений, тогда как более ранняя утечка NPD включала номера социального страхования и другие персональные данные. Масштаб более свежего инцидента описывался лишь приблизительно — как возможное затрагивание примерно половины жителей США — и не был подтвержден точной статистикой. Согласно представленной оценке, повторные утечки могут повышать будущий риск фактической кражи личности.

Aura заявляет, что использует foundation model для анализа последовательностей событий, включая утечки данных и появление информации в даркнете, чтобы оценивать риск. Пользователям рекомендуется следить за кредитной историей, номерами карт и операциями, не дожидаясь полной выписки, а также обращать внимание на необычную физическую почту, поскольку цифровая информация все чаще связана с физическими преступлениями.

Aura строит корпоративную защиту вокруг пересечения потребительской и рабочей среды

Корпоративная модель Aura в сфере безопасности основана на том, что граница между домом и работой стала размытой. Компания продаёт свой продукт крупным предприятиям и общается с их CISO, которые отмечают: для защиты бизнеса всё чаще необходимо учитывать потребительскую среду сотрудников.

Aura утверждает, что многие корпоративные мошеннические схемы и утечки начинаются на потребительской стороне и используют сотрудников как канал социальной инженерии. Компания считает повышение осведомлённости потребителей об этих угрозах потенциально важной частью защиты предприятий; при этом конкретные продукты, контракты или показатели корпоративного направления не раскрыты.

Продукт для защиты идентичности персонализирует онбординг с помощью семейного графа

Компания заявляет, что уделяет значительное время упрощению онбординга продуктов для защиты идентичности и безопасности: настройка аккаунтов и правильное использование продукта могут быть препятствием. В качестве важной метрики она рассматривает time to value — скорость, с которой клиент получает первую практическую пользу.

Продукт ставит семью в центр системы и использует «семейный граф» для отображения связей между людьми. По словам компании, ее системы рассуждения и вывода используют этот контекст, чтобы формировать целостное представление о клиенте и персонализировать онбординг и последующий мониторинг.

Компания сообщает о примерно $340 млн и более годовой регулярной выручки

Компания сообщает, что достигла примерно $340 млн и более годовой регулярной выручки (ARR).

Точная сумма не уточняется и обозначена лишь как приблизительная.

В анонсе GPT-6 Astra заявлен результат 99,9% в ArcAGI-3

Пост о GPT-6 Astra опубликован на openai.com. Среди заявленных результатов — 99,9% в ArcAGI-3, что было названо особенно впечатляющим, и 64,6% в научной части Terminal Bench при максимальном уровне рассуждений; указанная стоимость составила $26.

Также сообщается, что GPT-6 Astra получил 0% в бенчмарке-ловушке Exploit Gym, где более низкий результат лучше, а также показал высокие результаты в использовании компьютера и на экзаменационном тесте. Запуск сочли слишком свежим и хаотичным для окончательной оценки; методология и контекст бенчмарков не раскрыты.

Дебаты поставили под вопрос ценность многолетнего скептицизма Эда Зитрейна в отношении ИИ

Эда Зитрейна характеризуют как давно настроенного скептически по отношению к ИИ; приближается трехлетняя годовщина его «медвежьих» прогнозов. В дебатах ставится вопрос о пользе регулярно повторяющихся пессимистичных прогнозов, при этом отмечается, что со временем скептицизм и оптимизм могут меняться.

Кевин Руз утверждает, что любой, кто брал интервью у Зитрейна или приглашал его ради скептического взгляда на ИИ, сделал свою аудиторию «глупее и менее подготовленной» к тому, что грядет. Эрик Ньюкомер говорит, что аудитория Зитрейна следует за ним. Представленные материалы не устанавливают, справедлива ли критика прогнозов Зитрейна; также высказывается мнение, что продолжение прогнозирования после ошибок может свидетельствовать скорее о настойчивости, чем об уверенности.

Jump строит Shopify-подобную direct-to-consumer-платформу для спортивных болельщиков

Jump, основанная Джорди совместно с Марком Лором и Алексом Родригесом, запустила внутреннюю билетную платформу с Minnesota Timberwolves. Система позволяет болельщикам искать и покупать билеты в приложении команды, а самой команде — получать доступ к данным клиентов, которые обычно остаются у сторонних билетных операторов.

Предлагаемый единый аккаунт Timberwolves должен объединить билеты с мерчандайзом, коллекционными товарами, едой и напитками, парковкой, дополнительными услугами, контентом и медиа. Платформа может использовать данные о просмотрах, брошенных корзинах и посещаемости для автоматических сообщений и персонализации продаж или дополнительных предложений, в том числе для случайных покупателей билетов на отдельные матчи.

Компания описывает эту модель как Shopify-подобные прямые отношения между командами и болельщиками и считает, что в спорте высшего уровня такого контроля над клиентскими отношениями не хватает. В источниках нет количественных данных о внедрении, выручке или конверсии Jump либо платформы Timberwolves.

Jump объединяет автоматизированное ценообразование билетов с открытой дистрибуцией на маркетплейсах

Jump, как описывается, делает ценообразование спортивных билетов более автоматизированным при работе с большими объёмами мест. На арене примерно с 20 000 мест, из которых около 10 000 продаются как минимум на 41 матч в год, меняющийся спрос и предложение в противном случае требуют частого ручного обновления цен. Заявленная цель — сохранять выручку или снижать цены на отдельные матчи, чтобы помогать заполнять арену.

Билеты, размещённые на Jump, также могут распространяться через Ticketmaster TM+, SeatGeek, StubHub и другие вторичные рынки, предоставляя большему числу покупателей доступ к одному и тому же предложению и потенциально повышая цены при высоком спросе. Эта модель представлена как способ дать командам контроль над дистрибуцией, вместо того чтобы каждый маркетплейс удерживал билеты внутри собственной системы. Она также отражает прогноз, что ИИ окажет значительное влияние на спорт.

Portal Space Systems разрабатывает маневренные космические аппараты для обороны и исследований

Основатель Portal Space Systems заявил, что компания разрабатывает высокоманевренные космические аппараты для обороны, описывая их как «истребители для орбиты», а также стремится поддерживать NASA и гражданские космические исследования. По его мнению, многие космические аппараты слишком предсказуемы и ограничены запасом топлива в условиях растущей конкуренции на орбите.

По словам основателя, в компании, расположенной к северу от Сиэтла, работает около 60 человек. В марте Portal вывела на орбиту свою первую миссию для испытания электронной аппаратуры и завершила создание космического аппарата Starburst массой примерно 600 фунтов, запуск которого запланирован на 19 октября для демонстрации ряда возможностей компании.

Основатель ожидает, что всё больше компаний будут развивать значительный оборонный бизнес по мере того, как государственные ведомства охотнее сотрудничают с индустрией, а реформы закупок ускоряют передачу возможностей военным. Он также ожидает, что часть космической деятельности, связанной с национальной безопасностью, останется нераскрытой.

Base10 делает ставку на сотни миллионов ИИ-моделей

Base10 делает ставку на рост числа ИИ-моделей — примерно с пяти миллионов, которые, предположительно, обучены на Hugging Face, до сотен миллионов.

Прогноз предполагает сочетание мощных закрытых frontier-моделей и гораздо большего числа открытых или специализированных моделей — возможно, по одной модели на человека или даже по нескольку десятков. При этом остаётся неопределённым, появится ли в будущем одна модель на каждого человека или несколько.

Открытые и закрытые ИИ-лаборатории в основном масштабируют один и тот же рецепт обучения

Согласно оценке текущего развития моделей, между стеком reinforcement learning OpenAI, китайскими open-source-разработками и американскими open-source-проектами существует мало различий. Сначала масштабировались предварительное обучение и размер моделей, а теперь масштабируется reinforcement learning (RL).

Ожидается, что лаборатории продолжат масштабировать RL, рассчитывая на достижение более высоких уровней интеллекта и выполнение большего числа экономически полезных задач. Отдельно важным приоритетом называется непрерывное обучение.

BaseLabs объявила о долгосрочном исследовании персонального continual learning

BaseLabs объявила о долгосрочном исследовательском направлении, посвящённом continual learning. Проект предполагает, что открытая модель будет органично адаптироваться к информации о конкретной компании, команде или человеке, а не полагаться только на внешние файлы памяти.

Этот подход противопоставляется циклу обновления моделей, который используется крупными лабораториями, такими как OpenAI и Anthropic: они обучают модель, выпускают её, собирают обратную связь и создают среды reinforcement learning для устранения пробелов. По оценке BaseLabs, персональный continual learning может открыть новые архитектурные или продуктовые парадигмы, однако пока неясно, какие именно подходы окажутся жизнеспособными.

Модели ИИ могут эффективнее оцениваться по порогам полезности для конкретных задач

В рамках анализа предлагается оценивать большие языковые модели по тому, достигают ли они порога интеллекта, необходимого для конкретной задачи, а не по единому абсолютному рейтингу. Ниже этого порога задачу выполнить нельзя, а выше него дополнительный интеллект дает резко убывающую отдачу.

По этой оценке, закрытые модели обычно достигают нужных порогов первыми, тогда как открытые могут догонять их примерно через шесть—девять месяцев, хотя задержка зависит от задачи. После достижения порога многие экономически ценные приложения могут предпочесть открытые модели ради контроля и специализированного улучшения; при этом для передовой науки и математики спрос на максимальный интеллект остается крайне неэластичным.

Ожидается, что компании, создающие ИИ-продукты, будут использовать отзывы пользователей, чтобы улучшать модели под приоритетные задачи, а не оставаться оболочками над чужими моделями. Экосистема пока считается недостаточно зрелой, чтобы большинство компаний самостоятельно обучали такие модели, но со временем это может стать более распространенным.

BaseLabs рассматривает открытые RL-среды как способ сократить отставание от крупных лабораторий

BaseLabs заявляет, что его задача — сделать открытые модели, а в перспективе, возможно, и закрытые модели максимально полезными. Помимо агрегации вычислений, проект рассматривает агрегацию данных и создание сложных сред для обучения с подкреплением для открытого сообщества.

По оценке проекта, закрытые лаборатории тратят на RL-среды миллиарды долларов в год. BaseLabs сообщает, что последние несколько лет создавала среды для отдельных пользователей и рассматривает возможность выпустить их для всех, чтобы на них могли обучаться открытые и закрытые поставщики. Пока неясно, сможет ли BaseLabs создать среды, сопоставимые со средами крупных лабораторий, и достаточно ли дистилляции и доступных данных, чтобы сократить разрыв.

Ценности моделей становятся отдельной проблемой разработки ИИ

По мере того как открытые модели приближаются к закрытым по своим возможностям и экономически ценным задачам, заложенные в них ценности становятся отдельной проблемой разработки. Ценности, этика и мораль формируются — прямо или косвенно — на этапах предварительного, промежуточного и последующего обучения, а также классификаторами и системами безопасности.

Неясность ценностей китайских открытых моделей называется одной из причин, по которым многие американские компании не хотят их использовать. Важный нерешённый исследовательский вопрос — можно ли органично формировать ценности модели под страну, компанию или отдельного человека, в том числе с помощью возможного «пост-пост-обучения».

Доверие к бенчмаркам, как отмечается, находится на исторически низком уровне и может продолжить снижаться, что усложняет коммуникацию ценности новых моделей.

BaseLabs предлагает оценивать ИИ-модели по реальному экономическому использованию

BaseLabs считает, что традиционные бенчмарки ИИ часто проверяют узкие типы ошибок. ArcAGI приводится как пример специализированной области, в которой модели исторически показывали слабые результаты; после публикации бенчмарк также может стать целью обучения с подкреплением и частично утратить независимость.

Компания утверждает, что набора из 10 бенчмарков недостаточно для полного описания сильных сторон и неровного профиля возможностей модели. По ее мнению, наиболее надежный сигнал дает объединение оценок, созданных компаниями для реальных оплачиваемых задач. BaseLabs заявляет, что ее тысячи пользователей и масштабируемые RL-среды могут предоставить такой сигнал, признавая при этом отсутствие универсального способа измерить полезность модели.

Continual learning остаётся допарадигмальной областью на фоне поиска новых методов компактизации

Continual learning остаётся «допарадигмальной» областью: общепринятого определения нет. Одни подходы рассматривают его как поиск и организацию информации в контекстном окне, другие требуют обновлять модель на каждом токене; последнее может по-разному повреждать модель.

Компактизация описывается как сравнительно зрелая практика в Codex от OpenAI и Claude Code от Anthropic, где сжатие сейчас выполняют модели-суммаризаторы. Возможны более продвинутые нейронные компакторы, работающие в пространстве KB-кэша, однако значительная часть соответствующих исследований остаётся внутри закрытых лабораторий.

BaseLabs позиционирует себя как проект, стремящийся вынести эту работу в открытую среду без давления выпустить лучшую модель в текущем квартале. Согласно анализу, исследования компактизации и continual learning могут превратить область в более систематическую науку.

Continual learning остаётся нерешённым для повседневных AI-систем

Для передовых AI-лабораторий continual learning может быть достигнут за счёт ускорения уже существующего цикла обучения: сбора данных, создания сред для обучения с подкреплением и переобучения моделей. Согласно анализу, по мере роста доступных вычислений более крупные модели смогут совершенствовать архитектуру, снижать ошибку на этапе предварительного обучения и самостоятельно создавать RL-среды в большом масштабе.

Однако такой подход не решает проблему continual learning для обычных AI-native стартапов, предприятий и специализированных агентов. Агент-юрист, которого обучают сложным связям и неявным практикам фирмы, может деградировать при supervised fine-tuning, а reinforcement learning может не обеспечивать нужное усвоение знаний. Удовлетворительного решения пока нет; оценка проблемы зависит от того, как определяется continual learning и для какого применения он рассматривается.

Snowflake изучает партнерства с быстрорастущими ИИ-стартапами

Snowflake уделяет значительное время встречам со стартапами и устоявшимися компаниями, обсуждая возможности применения ИИ и потенциальные партнерства. Компания также работает с продуктовыми и инженерными командами над новыми идеями, поскольку ИИ упрощает создание программного обеспечения, говорится в источнике.

В источнике описан стартап, существующий менее трех месяцев и уже имеющий десятки клиентов, использующих его платформу для обучения с подкреплением; встреча, вероятно, состоялась «позавчера», хотя точные сроки не определены. Snowflake обсуждала возможное партнерство, отмечая, что идеи в сфере ИИ могут быстро пройти путь от концепции до прототипа, функции продукта и широкого клиентского внедрения.

Snowflake смещает фокус роста с численности на использование ИИ

Snowflake подчёркивает, что масштаб компании больше не определяется прежде всего ростом штата: ИИ может автоматизировать многие задачи, которые раньше требовали участия людей. Компания считает, что мерой роста должны в большей степени служить качество решений, эффективность и способность определять способы выполнения работы, а не размер организации.

Ожидается рост некоторых функций, прежде всего связанных с внешним миром, например аккаунт-менеджеров, работающих с клиентами, которые тратят значительные суммы. В других областях, включая разработку, агентный ИИ может обеспечить существенный прирост эффективности. Snowflake также продолжает нанимать молодых сотрудников с ИИ-ориентированным мышлением.

Компания считает одной из главных организационных задач создание условий для экспериментов малых команд. CoCo назвали выдающимся успешным проектом: большую часть времени над ним работало не более пяти человек, и сейчас команда остаётся очень небольшой.

Snowflake разрабатывает внутренний Enterprise Brain для обмена знаниями

Snowflake работает над внутренним проектом «Enterprise Brain», который должен собирать важные сведения о деятельности компании и направлять нужную информацию соответствующим сотрудникам. Внутренний обмен информацией в компании пока остается незавершенной задачей.

Этот подход призван сократить ненужное присутствие на встречах: сотрудникам, которым нечего добавить, предлагается читать протоколы. ИИ также может упростить регулярную отчетность о выполненной работе и существенно изменить масштабы управления и подчиненности, хотя Snowflake недавно не измеряла, увеличивается или сокращается время внутренних встреч.

Snowflake готовится к скачкам возможностей ИИ и оптимизирует выбор моделей и расходы на токены

В Snowflake ожидают, что будущие скачки возможностей ИИ могут увеличить расходы, хотя более дешёвые модели, системы с открытым исходным кодом и повышение эффективности способны их сократить. В компании считают затраты на токены оправданными, когда они дают реальные бизнес-результаты, но ставят создание продуктов и их внедрение клиентами выше попыток минимизировать расход токенов любой ценой.

Для контроля расходов Snowflake оптимизирует выбор моделей по умолчанию и графы задач, передавая более простые операции менее дорогим моделям. Компания также использует AI Gateway для повышения эффективности доступа к моделям и экспериментирует с моделями с открытыми весами через собственный инструментарий CoCo. Команды поддержки и обеспечения надёжности обрабатывают десятки тысяч предупреждений в день, что создаёт значительные возможности для оптимизации токенов.

Snowflake ставит бизнес-результаты корпоративного ИИ выше маршрутизации моделей

Snowflake строит свою ИИ-стратегию вокруг широкого корпоративного внедрения и бизнес-результатов, а не только маршрутизации моделей. Компания сообщает, что внедрения Cowork уже охватывают тысячи пользователей внутри отдельных компаний; при этом она стремится расширить использование Cowork среди сотрудников, а CoCo — среди инженеров по работе с данными.

Gateway от Snowflake должен обеспечивать доступ к моделям, а также регулируемый доступ к корпоративным инструментам и приложениям, включая MCP-инструменты. Компания также экспериментирует с решениями для безопасности траекторий действий агентов, чтобы предотвращать неправомерное использование моделей.

Snowflake считает маршрутизацию моделей полезной инфраструктурной возможностью, но видит более крупную перспективу в создании ценности на основе важных данных клиентов.

Snowflake назвала приобретение Natoma примером своей стратегии в области данных и ИИ

Snowflake заявляет, что оценивает приобретения по тому, ускорит ли присоединение компании ее миссию как платформы данных и ИИ. Компания считает своей сильной стороной помощь клиентам в получении выводов и принятии решений на основе важных данных.

Snowflake называет приобретение Natoma ярким примером такого подхода. Компания заявляет, что MCP становится все более важным, поскольку может предоставлять контекст в реальном времени из таких коммуникаций, как Slack и электронная почта, непосредственно в ИИ-хранилище, принося пользу Snowflake и ее клиентам.

Lex Speedman ускоряет речь Лекса Фридмана в подкасте вдвое

Продукт Lex Speedman, доступный на сайте lexspeedman.com, ускоряет речь Лекса Фридмана в 2 раза, оставляя скорость речи его гостя на уровне 1x.

Создатель инструмента Марио Дион сообщил, что разработал его, поскольку хотел посмотреть выпуск с DHH, но считал, что Фридман говорит слишком медленно. Утверждается, что продукт сокращает продолжительность выпуска максимум на 20%, однако неизвестно, какую долю обычного выпуска Фридман занимает своей речью.

Astra GPT-6 назвали новым передовым результатом на ARC AGI-3, но доказательств AGI пока недостаточно

О релизе Astra GPT-6 было заявлено. В видео Мэтт Шумер, как утверждается, за один проход создал игру в Unreal Engine; поддержка MCP в движке, по описанию, позволяет разрабатывать игры посредством общения с моделью.

Майк из ARC назвал Astra новым передовым результатом на ARC AGI-3 и качественно большим шагом к AGI, отметив удивительный темп прогресса. При этом ARC заявляет, что доказательств для классификации Astra как AGI пока недостаточно.

Открытое изобретательство остаётся нерешённым пробелом по сравнению с человеческими возможностями и может стать основой ARC AGI-4, потенциально потребовав создания новой науки или физики.

Конфиденциальность ·