TBPN

September 3, 2026

52 stories / новостей

A Wave of New AI Model Releases and Teasers

The week brought an unusually dense set of AI model releases and announcements. The names cited included Anthropic Fable 5.1, MuseSpark 1.3 and Gemini 3.8 Flash, while OpenAI was teasing Astra.

It remained unclear which items were full launches and which were teasers. A possible GPT-6 was only speculation based on a visual clue—a “6” appearing where the “S” goes in one video. The high pace of model updates was described as continuing after the labs returned from summer vacations.

Волна новых релизов и тизеров ИИ-моделей

На этой неделе наблюдалась необычно высокая плотность релизов и анонсов ИИ-моделей. Среди упомянутых названий — Anthropic Fable 5.1, MuseSpark 1.3 и Gemini 3.8 Flash, а OpenAI тизировала Astra.

Оставалось неясно, какие из этих продуктов были полноценными запусками, а какие — тизерами. Возможный GPT-6 был лишь предположением, основанным на визуальной подсказке: в одном из видео цифра «6» появилась на месте буквы «S». Высокий темп обновлений моделей, как отмечалось, продолжился после возвращения лабораторий с летних каникул.

Grok, Claude and OpenAI Reportedly Went Down as a Possible AWS Link Emerged

Grok, Claude and OpenAI services were reported unavailable that morning, prompting speculation that the disruption might involve AWS or Amazon’s US East 1 region. The cause was not established, and the AWS connection remained a hypothesis.

It was later clarified that Gemini had not gone down. There was also an unconfirmed suggestion that Astra might have escaped, though the meaning of that possibility remained unclear.

The incident was characterized as a possible “deflock moment” for AI, while Amazon was described as critical to the global internet.

Grok, Claude и OpenAI, предположительно, столкнулись со сбоем; обсуждалась возможная связь с AWS

Утром сервисы Grok, Claude и OpenAI, как сообщалось, были недоступны, что вызвало предположения о возможной связи сбоя с AWS или регионом Amazon US East 1. Причина установлена не была, а связь с AWS оставалась гипотезой.

Позднее уточнили, что Gemini не отключался. Также прозвучало неподтверждённое предположение, что Astra могла «сбежать», однако смысл этой версии остался неясным.

Инцидент назвали возможным «deflock-моментом» для ИИ, а Amazon — критически важной частью глобального интернета.

Meta’s MuseSpark 1.3 posts strong benchmark results but does not sweep evaluations

Meta’s MuseSpark 1.3 was reported to score 75.4% higher than Gemini 3.8 Flash on DeepSuite, surpassing Opus 5 and GPT-5.6 SOL in that comparison. It scored 62 on the Artificial Intelligence Index, reportedly behind only the newest Claude models.

The model was not a universal leader: Opus 5 still outperformed it in several professional-work and computer-use evaluations. The comparability of DeepSuite with the other assessments, as well as independent reproducibility of the results, was not established.

MuseSpark 1.3 от Meta показала сильные результаты в бенчмарках, но не стала лидером во всех оценках

По приведённым результатам, MuseSpark 1.3 от Meta набрала на 75,4% больше Gemini 3.8 Flash в DeepSuite, опередив в этом сравнении Opus 5 и GPT-5.6 SOL. В индексе искусственного интеллекта модель получила 62 балла — предположительно уступив только новейшим моделям Claude.

Модель не стала безусловным лидером: Opus 5 по-прежнему превосходил её в ряде оценок профессиональной работы и использования компьютера. Сопоставимость DeepSuite с другими оценками и независимая воспроизводимость результатов не были установлены.

Anthropic’s Fable 5.1 Scores 66 as EFS Replaces No-ZDR Policy

Anthropic’s Fable 5.1 scored 66 on the Artificial Intelligence Index, described as the highest result on the index and ahead of Opus 5 at 63 and Fable at 62. Anthropic says an improved caching system should make ordinary workloads 25% cheaper and long-horizon agentic jobs 45% cheaper; these percentages are company claims rather than independent measurements.

Anthropic is set to replace its no-zero-data-retention policy with Enterprise Frontier Safeguards (EFS). Under the new regime, some data is retained on servers and infrastructure owned by the company, while usage continues to be monitored for hostile activity. The change may have contributed to lower enterprise adoption of Fable, but that connection remains uncertain.

Fable 5.1 от Anthropic набрала 66 баллов на фоне замены политики No-ZDR на EFS

Fable 5.1 от Anthropic набрала 66 баллов на Artificial Intelligence Index — этот результат назван высшим в истории индекса; модель опередила Opus 5 с результатом 63 и Fable с 62 баллами. Anthropic заявляет, что улучшенная система кэширования должна снизить стоимость обычных рабочих нагрузок на 25%, а длительных агентных задач — на 45%; эти показатели являются заявлением компании, а не результатом независимого измерения.

Anthropic намерена заменить политику полного отказа от хранения данных на Enterprise Frontier Safeguards (EFS). При новом режиме часть данных будет сохраняться на серверах и инфраструктуре, принадлежащих компании, а использование по-прежнему будет контролироваться на предмет враждебной активности. Это изменение могло способствовать более низкому внедрению Fable корпоративными клиентами, однако такая связь остается неопределенной.

Google’s Gemini 3.8 Flash posts 73.7% on DeepSWE at roughly 300 tokens per second

Google released Gemini 3.8 Flash, described as its third Flash release in six weeks. The model reportedly scored 73.7% on the DeepSWE coding benchmark, just behind Opus-5 and competitive with models costing several times more. Independent testing gave it an intelligence score of 59, which is not the absolute frontier but was characterized as a strong result for a model generating roughly 300 tokens per second.

The model was described as very fast, inexpensive and effective at coding on this particular benchmark. Its speed and lower cost could help it compete with more expensive models, but actual adoption and the effect on enterprise spending remain uncertain.

Gemini 3.8 Flash набрала 73,7% в DeepSWE при скорости около 300 токенов в секунду

Google выпустила Gemini 3.8 Flash, названную третьим Flash-релизом компании за шесть недель. По приведённым данным, модель набрала 73,7% в кодинговом бенчмарке DeepSWE — немного уступив Opus-5 и показав результат, сопоставимый с моделями, которые стоят в несколько раз дороже. Независимое тестирование дало ей показатель интеллекта 59: это не абсолютный передовой уровень, но сильный результат для модели со скоростью генерации около 300 токенов в секунду.

Модель характеризовали как очень быструю, недорогую и эффективную в кодинге по этому конкретному бенчмарку. Её скорость и более низкая стоимость могут позволить конкурировать с более дорогими моделями, однако фактическое внедрение и влияние на корпоративные расходы пока остаются неопределёнными.

Trust in AI benchmarks is weakening as practical evaluations gain ground

Trust in standard AI benchmarks is weakening amid accusations of “bench hacking” and difficulties interpreting their results. An analysis suggested that the era of widely shared aggregate bar charts may be nearing its end, though it did not establish that any specific models were optimized for tests.

Alternative signals include solving novel math problems, practical demonstrations such as building a game, and recommendations from experienced users. People with substantial hands-on experience are increasingly forming their own internal assessments of models.

The Artificial Intelligence Index was described as a way to compress multiple benchmarks into a single meta-benchmark, but it remains unclear how well that composite measure reflects models’ real professional capabilities. As models develop, performance on new tasks and real-world work scenarios may become more important than standard tests.

Доверие к бенчмаркам ИИ снижается на фоне роста интереса к практической оценке

Доверие к стандартным бенчмаркам ИИ снижается из-за обвинений в «bench hacking» — оптимизации под тесты — и сложностей с интерпретацией результатов. В аналитической оценке прозвучало предположение, что эпоха широко распространяемых сводных бар-чартов может приближаться к завершению, однако не было установлено, что конкретные модели действительно оптимизировались под тесты.

В качестве альтернативных сигналов назывались решение новых математических задач, практические демонстрации — например создание игры — и рекомендации опытных пользователей. Люди с большим опытом работы с моделями всё чаще формируют собственные внутренние оценки их возможностей.

Artificial Intelligence Index описывался как способ объединить несколько бенчмарков в единый метабенчмарк, однако неясно, насколько такой сводный показатель отражает реальные профессиональные возможности моделей. По мере развития ИИ результаты на новых задачах и в реальных рабочих сценариях могут стать важнее стандартных тестов.

Enterprise AI Revenue Is Highly Concentrated Among the Largest Companies

Estimates cited in the analysis indicate that 80% of OpenAI’s and Anthropic’s enterprise revenue comes from 1% of companies. That concentration was described as unusually high compared with software categories such as CRM and databases.

For comparison, the largest 1% of U.S. companies by sales are said to generate about 80% of total business revenue and employ roughly 65% of the workforce. Total AI spending was estimated at around $150 billion a year, or about 0.25% of U.S. business revenue.

One interpretation is that the largest companies may account for about 80% of AI spending as well, because enterprise AI is often consumption-based rather than sold through fixed $20 or $200 plans. The analysis emphasized that the relationship between company revenue and AI spending may be correlational rather than causal, and that the estimates are approximate.

Доходы корпоративного рынка ИИ сильно сконцентрированы среди крупнейших компаний

Согласно приведённым в анализе оценкам, 80% корпоративной выручки OpenAI и Anthropic приходится на 1% компаний. Такой уровень концентрации был назван необычно высоким по сравнению с программными категориями вроде CRM и баз данных.

Для сравнения, крупнейший 1% американских компаний по объёму продаж, как утверждается, генерирует около 80% общей выручки бизнеса и обеспечивает занятость примерно 65% рабочей силы. Совокупные расходы на ИИ оценивались примерно в 150 млрд долларов в год, или около 0,25% выручки американского бизнеса.

Одна из интерпретаций состоит в том, что на крупнейшие компании также может приходиться около 80% расходов на ИИ, поскольку корпоративные решения часто оплачиваются по потреблению, а не по фиксированным тарифам в 20 или 200 долларов. При этом подчёркивалось, что связь между выручкой компаний и расходами на ИИ может быть корреляционной, а не причинной, а сами оценки являются приблизительными.

Clipping Live Streams Becomes a Social Media Activity

People watch live streams, cut clips from them and publish the excerpts on social media. TikTok and Instagram are cited as platforms where these clips appear.

The activity is described as especially common in Los Angeles and was referenced as an homage behind a team’s name, though the team itself is not identified.

Нарезка прямых трансляций становится активностью в соцсетях

Люди смотрят прямые трансляции, вырезают из них клипы и публикуют получившиеся фрагменты в социальных сетях. В качестве площадок для таких клипов упоминаются TikTok и Instagram.

Эта активность описывается как особенно распространённая в Лос-Анджелесе и как отсылка, легшая в основу названия одной команды, однако сама команда не названа.

Siphon gets a large funding round from Altimeter

Siphon has received a large funding round from Altimeter.

The size of the round, the company’s valuation and the funding date were not specified.

Siphon получила крупный раунд финансирования от Altimeter

Siphon получила крупный раунд финансирования от Altimeter.

Размер раунда, оценка компании и дата финансирования не уточнялись.

Pocket says it has sold 300,000 wearable conversation recorders

Pocket says it has sold 300,000 devices. The company first released a meeting note-taking app, but reported that people used its hardware 10 times more often. It then developed a wearable for phones that is not always on, aiming to make recording conversations faster and less awkward than using a phone.

The device costs $129 and includes a freemium subscription with unlimited summaries, unlimited transcripts and three daily questions about conversations. A Pro plan costs $20 per month or $200 per year and adds speaker features, advanced AI models and access to more than 300 professionally sourced templates.

Pocket says its users include field workers, consultants, salespeople and real-estate agents. DoorDash uses the device for salespeople to record pitches and share them in a knowledge base, while recordings and transcripts can be connected to Claude, MCP or OpenAI’s API.

Pocket заявила о продаже 300 000 носимых устройств для записи разговоров

Pocket заявила, что продала 300 000 устройств. Сначала компания выпустила приложение для ведения заметок на встречах, но, по ее данным, люди использовали аппаратное устройство в 10 раз чаще. После этого она разработала подключаемый к телефону носимый гаджет, который не работает постоянно, чтобы сделать запись разговоров быстрее и менее неловкой, чем запись на телефон.

Устройство стоит $129 и поставляется с условно-бесплатной подпиской: безлимитными саммари и расшифровками, а также тремя ежедневными вопросами о разговорах. Тариф Pro стоит $20 в месяц или $200 в год и добавляет функции работы с говорящими, продвинутые ИИ-модели и доступ более чем к 300 профессионально подготовленным шаблонам.

Pocket заявляет, что ее пользователи — выездные сотрудники, консультанты, продавцы и агенты по недвижимости. DoorDash использует устройство, чтобы продавцы записывали презентации и делились ими в базе знаний, а записи и расшифровки можно подключать к Claude, MCP или API OpenAI.

Snowflake reports $1.49 billion quarter as AI products gain broad adoption

Snowflake reported quarterly revenue of $1.49 billion, up 37% year over year. The company said its AI products, CoCo and Cowork, are seeing broad adoption.

Snowflake also described intense competition from hyperscalers and foundation-model labs. The company said there is substantial business opportunity, while noting that its product and go-to-market teams face significant change and must keep adapting.

Snowflake сообщила о квартальной выручке $1,49 млрд на фоне широкого внедрения ИИ-продуктов

Snowflake сообщила о квартальной выручке в размере $1,49 млрд, что на 37% больше показателя годом ранее. Компания заявила, что ее ИИ-продукты CoCo и Cowork получают широкое распространение.

Snowflake также описала конкуренцию со стороны гиперскейлеров и лабораторий, разрабатывающих базовые модели, как интенсивную. Компания считает, что возможности для бизнеса остаются значительными, однако ее продуктовым командам и командам выхода на рынок приходится адаптироваться к масштабным изменениям.

Astra benchmark results surface before official launch

Lisan Al-Ghaieb shared benchmark results attributed to Astra while the AI system still had no official launch announcement. The figures were 98.6 on Arc AGI 3 and 97.6 on Frontier Math Tier 4 V2.

Astra was also reported at 74.1 on DeepSWE and 100% on Exploit Bench. The results appear strong, but it is unclear whether they represent the final version, and no launch date was given.

Результаты бенчмарков Astra появились до официального запуска

Lisan Al-Ghaieb опубликовал результаты бенчмарков, приписываемые Astra, хотя официального объявления о запуске этой ИИ-системы всё ещё не было. Показатели составили 98,6 на Arc AGI 3 и 97,6 на Frontier Math Tier 4 V2.

Также для Astra заявлены 74,1 на DeepSWE и 100% на Exploit Bench. Результаты выглядят сильными, однако неясно, относятся ли они к финальной версии; дата запуска не названа.

John Palmer suggests Snapchat-like short videos for workplace communication

John Palmer suggested that “Snapchat for work” could be a good idea for today’s large companies. The proposal envisions short selfie videos or screen recordings as a way for teams to communicate and demonstrate what they are working on.

The idea is presented as a serious possibility, though it remains unclear whether it is a product proposal or commentary. It reflects the view that workplace communication platforms often adopt formats previously popular with teenagers; one proposed example is a two-minute demo video, potentially with Snapchat-style filters.

Джон Палмер предложил использовать короткие видео в стиле Snapchat для рабочих коммуникаций

Джон Палмер предложил, что «Snapchat для работы» может быть хорошей идеей для современных крупных компаний. Концепция предполагает использование коротких селфи-видео или записей экрана для командного общения и демонстрации текущей работы.

Идея представлена как вполне серьезная возможность, хотя остается неясным, идет ли речь о продуктовом предложении или комментарии. Она опирается на представление о том, что рабочие коммуникационные платформы часто перенимают форматы, ранее популярные у подростков; в качестве примера предлагается двухминутное демонстрационное видео, возможно с фильтрами в стиле Snapchat.

California Town Sale Sparks Speculation About a Data-Center Workaround

A town in California is cited as being offered for sale, with quoted prices of $6 million and, in a later reference, $17 million. The town’s identity and the reason for the price discrepancy are not resolved.

The sale is linked to ongoing difficulties developing data centers amid local opposition. Buying an entire town is presented as a joke or hypothetical way for a developer to avoid a town government rejecting a project; the data-center purpose is speculative, not a stated reason for the sale.

Продажа города в Калифорнии вызвала предположения об обходе сопротивления дата-центрам

Упоминается город в Калифорнии, выставленный на продажу: называются цены в $6 млн и, в более поздней ссылке, $17 млн. Название города и причина расхождения в ценах не установлены.

Продажа связывается с сохраняющимися трудностями при строительстве дата-центров из-за местного сопротивления. Покупка целого города представлена как шутливый или гипотетический способ избежать отказа со стороны городских властей; назначение сделки для дата-центра является предположением, а не заявленной причиной продажи.

Super Grok appears to wind down Companion as the business case for AI companions faces scrutiny

Super Grok is reportedly saying goodbye to Companion, although the exact status and timing of the wind-down are not established. Replika and other romantic-companion products are cited as having achieved adoption and scale, but the analysis questions whether the category can support a very large business.

One assessment said adult-entertainment features might once have helped Grok reach single-digit billions in revenue, but that estimate may have been too high. The analysis argues that the market has shifted toward enterprise software, which appears to offer substantially greater commercial value than the controversial companion category.

Super Grok, по-видимому, сворачивает Companion на фоне сомнений в бизнес-потенциале ИИ-компаньонов

Сообщается, что Super Grok прощается с Companion, однако точный статус продукта и сроки сворачивания не установлены. В качестве примеров продуктов, добившихся принятия и масштаба в категории романтических компаньонов, приводятся Replika и другие сервисы, но анализ ставит под сомнение способность этого сегмента поддерживать очень крупный бизнес.

Согласно одной из оценок, функции для индустрии развлечений для взрослых в прошлом могли помочь Grok выйти на выручку в несколько миллиардов долларов, однако эта оценка могла быть завышенной. В анализе говорится, что рынок сместился в сторону корпоративного программного обеспечения, которое, по-видимому, предлагает значительно большую коммерческую ценность, чем спорная категория компаньонов.

Fish.audio’s New York Subway Billboard Puzzles Viewers

Fish.audio ran a billboard campaign in the New York City subway with the message: “We put voice AI on a silent sign.” The wording prompted questions about whether the advertisement was genuine or a prank, and about how an audio-focused product fits a medium that cannot be heard.

The company’s listed offerings include text-to-speech, speech-to-text, audio separation, voice changers and translation. Its site also identifies HeyGen and several games companies, including Clout Kitchen, as partners or customers; the company was suggested as a possible ElevenLabs competitor.

Рекламный щит Fish.audio в нью-йоркском метро озадачил зрителей

Fish.audio разместила рекламный щит в нью-йоркском метро с надписью: «Мы добавили голосовой ИИ на немую вывеску». Формулировка вызвала вопросы о том, является ли реклама настоящей или это розыгрыш, а также о том, как аудиопродукт соотносится с рекламным носителем, который нельзя услышать.

Среди заявленных продуктов компании — преобразование текста в речь, преобразование речи в текст, разделение аудио, изменение голоса и перевод. На сайте компании также указаны HeyGen и несколько игровых компаний, включая Clout Kitchen, как партнеры или клиенты; Fish.audio предположительно может быть конкурентом ElevenLabs.

NBA sanctions Clippers over alleged off-books payments to Kawhi Leonard

An investigation described in the supplied evidence alleges that Los Angeles Clippers owner Steve Ballmer arranged payments to Kawhi Leonard through four companies, including Aspiration, Locked In Insurance, Boingo Wireless and a scoreboard manufacturer. Documents reportedly specified $48 million for Leonard—$20 million in stock and $28 million in cash—for an unannounced deal, while the arrangements were presented as jobs, consulting agreements or fees. The evidence does not establish a final judicial finding on every allegation.

The NBA fined Leonard $700,000 and suspended Ballmer for one year. The league also took five first-round picks from the Clippers, imposed a $30 million penalty and required Ballmer to pay $50 million in outside legal fees. The Clippers’ president of business operations was suspended for a year, while the general manager and president of basketball operations received six-month suspensions.

Ballmer has threatened litigation against NBA commissioner Adam Silver. After Leonard reached a settlement with the league, the arbitration option was legally removed, according to the supplied account. The loss of draft picks is expected to create long-term competitive difficulties for the Clippers, while a possible sale of the franchise remains uncertain.

NBA наказала Clippers из-за предполагаемых неофициальных выплат Kawhi Leonard

Согласно представленным материалам расследования, владелец Los Angeles Clippers Steve Ballmer организовал выплаты Kawhi Leonard через четыре компании, включая Aspiration, Locked In Insurance, Boingo Wireless и производителя табло. В документах, как утверждается, была указана сумма $48 млн для Leonard — $20 млн акциями и $28 млн наличными — за необъявленную сделку; схемы оформлялись как рабочие места, консультационные соглашения или гонорары. Представленные материалы не устанавливают окончательный судебный вывод по каждому из обвинений.

NBA оштрафовала Leonard на $700 000 и отстранила Ballmer на один год. Лига также забрала у Clippers пять пиков первого раунда, назначила штраф $30 млн и обязала Ballmer оплатить $50 млн расходов на внешнего юриста. Президент бизнес-операций Clippers отстранён на год, а генеральный менеджер и президент баскетбольных операций — на шесть месяцев.

Ballmer пригрозил судебным иском комиссару NBA Adam Silver. После соглашения Leonard с лигой возможность арбитража была юридически устранена, говорится в представленных материалах. Потеря пиков, как ожидается, создаст для Clippers долгосрочные спортивные трудности, а возможная продажа франшизы остаётся неопределённой.

SiFin raises $44 million for an AI platform targeting the go-to-market context gap

SiFin has raised $44 million, Mohit Aron said. The company is developing a platform to help go-to-market teams collect, organize and use fragmented operational context, a problem Aron described as the “context gap.”

The proposed system would automatically gather data, keep humans in the loop, provide real-time coaching and let users query accumulated company context. Aron said the problem affects both small and large companies, with large enterprises as SiFin’s primary focus while smaller businesses would not be excluded.

Aron previously founded Nutanix and Cohesity, which he said each surpassed $1 billion in annual recurring revenue. He said Nutanix is public, while Cohesity had not yet gone public at the time of the discussion.

SiFin привлекла $44 млн на AI-платформу для устранения дефицита контекста в go-to-market-командах

SiFin привлекла $44 млн, сообщил Мохит Арон. Компания разрабатывает платформу, которая поможет go-to-market-командам собирать, систематизировать и использовать разрозненный операционный контекст — проблему, которую Арон назвал «дефицитом контекста».

Предлагаемая система будет автоматически собирать данные, оставлять человека в контуре принятия решений, обеспечивать коучинг в реальном времени и позволять задавать вопросы по накопленному контексту компании. По словам Арона, проблема характерна и для малых, и для крупных компаний: основным фокусом SiFin станут крупные предприятия, но небольшие компании также не будут исключены.

Ранее Арон основал Nutanix и Cohesity; по его словам, каждая из компаний превысила $1 млрд годовой регулярной выручки. Он сообщил, что Nutanix уже стала публичной компанией, а Cohesity на момент обсуждения еще не вышла на биржу.

Pocket bets on focused AI hardware after smartphone-replacement devices falter

Pocket argues that early AI hardware such as Rabbit, Humane and Friend failed to gain significant traction largely because they tried to replace the smartphone and do too much. In its view, users are more likely to adopt AI that fits into existing workflows than universal features such as ordering food, while narrowly focused products may have stronger product-market fit.

Examples cited include a circular children’s device with a camera, screen and object-finding games, and Stickerbox, which prints a cartoon or sticker after a child gives it a voice prompt. The analysis suggests that more AI-native devices for the real world will emerge, provided they offer a clear function at a clear price.

Pocket делает ставку на узкоспециализированные AI-устройства после неудач универсальных гаджетов

Pocket считает, что первые AI-устройства, включая Rabbit, Humane и Friend, не смогли получить значительную пользовательскую тягу главным образом потому, что пытались заменить смартфон и делали слишком много. По мнению компании, пользователи скорее примут AI, встроенный в существующие рабочие процессы, чем универсальные функции вроде заказа еды, а узкоспециализированные продукты могут лучше соответствовать product-market fit.

Среди приведённых примеров — круглый детский девайс с камерой, экраном и играми на поиск предметов, а также Stickerbox, который печатает мультфильм или наклейку после голосового запроса ребёнка. Анализ предполагает, что появится больше AI-native устройств для реального мира, если они будут предлагать понятную функцию по понятной цене.

Pocket outlines HIPAA, SOC 2, FCC and recording-consent measures

Pocket says it is HIPAA compliant and uses HIPAA-compliant servers for medical workloads. The company also considered SOC 2 compliance for enterprise use from the outset.

The company said a device with a Bluetooth radio would generally require FCC approval. To reduce consent-related risk, Pocket makes recording start and stop through a user button action.

The stated approach begins with the user’s consent—described as one-party consent in one state—and leaves users responsible for seeking consent from others. The company said people are often open to recording when asked and may welcome sharing the resulting transcript and meeting notes.

Pocket описала меры по HIPAA, SOC 2, FCC и согласию на запись

Pocket заявила, что соответствует требованиям HIPAA и использует HIPAA-совместимые серверы для медицинских рабочих нагрузок. По словам компании, соответствие SOC 2 для корпоративного использования учитывалось с самого начала.

Компания сообщила, что устройству с Bluetooth-радиомодулем, как правило, потребуется одобрение FCC. Чтобы снизить риски, связанные с согласием, Pocket запускает и останавливает запись нажатием кнопки пользователем.

Заявленный подход начинается с согласия пользователя — оно описано как согласие одной стороны в одном штате, — а получение согласия других людей компания оставляет на усмотрение пользователя. По словам компании, люди часто готовы согласиться на запись, если их попросить, и могут приветствовать передачу готовой расшифровки и заметок встречи.

Pocket Plans Agents That Turn Conversations Into Work Documents

Pocket’s roadmap for the next few months includes AI agents that would take context directly from conversations and turn meetings into reports, documents, PPTs, presentations and slides.

The company frames this as an interface for workflows in which conversations are converted into materials for a follow-up meeting. The plan points to development within about three months, but the actual launch timing, agent architecture and degree of autonomy have not been disclosed.

Pocket планирует агентов, превращающих разговоры в рабочие документы

В дорожную карту Pocket на ближайшие несколько месяцев входят ИИ-агенты, которые будут напрямую брать контекст из разговоров и превращать встречи в отчёты, документы, PPT, презентации и слайды.

Компания рассматривает это как интерфейс для рабочих процессов, в которых разговоры преобразуются в материалы для следующей встречи. План рассчитан примерно на три месяца, однако фактические сроки запуска, архитектура агентов и степень их автономности не раскрыты.

Pocket Claims Roughly 75% Margins Through AI Model Routing

Pocket says its AI software subscriptions have margins of roughly 75%. The company attributes the figure in part to its own OpenRouter-like system, which routes requests among different providers and models; users can choose the model used for summarization.

For transcription, Pocket says it uses open-source technology and its own models fine-tuned on OpenAI’s Whisper. The company says this flexibility lets it select the models it prefers and helps keep margins high. No financial data supporting the claimed margin was provided, and the criteria for choosing a specific model for each task were not disclosed.

Pocket заявляет о марже около 75% благодаря маршрутизации AI-моделей

Pocket заявляет, что маржа его программных AI-подписок составляет около 75%. Компания связывает этот показатель в том числе с собственной системой, аналогичной OpenRouter, которая направляет запросы к разным провайдерам и моделям; пользователи могут выбирать модель для суммаризации.

Для транскрибации Pocket, по собственным словам, использует технологии с открытым исходным кодом и модели, дообученные поверх OpenAI Whisper. Компания утверждает, что такая гибкость позволяет выбирать предпочтительные модели и поддерживать высокую маржу. Финансовые данные, подтверждающие заявленный показатель, не представлены, а критерии выбора конкретной модели для каждой задачи не раскрыты.

Pocket Fine-Tunes Whisper-Based Models for Noisy Offline Transcription

Pocket handles transcription itself and uses models fine-tuned on top of OpenAI’s Whisper. The company says this approach lets it choose the models it uses for transcription and summarization.

Many online transcription models were trained on extremely clean datasets, including YouTube-related data such as VoxCeleb, and work well for Zoom meetings and other clean online recordings. They can perform poorly on offline recordings with background noise, such as a nearby train, so Pocket fine-tunes its models for that environment. No quantitative improvement figures were provided.

Pocket дообучает модели на базе Whisper для шумной офлайн-транскрипции

Pocket самостоятельно обрабатывает транскрипцию и использует модели, дообученные на базе OpenAI Whisper. Компания заявляет, что такой подход позволяет ей выбирать модели для транскрипции и суммаризации.

Многие онлайн-модели транскрипции обучались на очень чистых наборах данных, включая связанные с YouTube данные, такие как VoxCeleb, и хорошо работают с Zoom-встречами и другими чистыми онлайн-записями. При офлайн-записях с фоновым шумом, например гулом проходящего рядом поезда, они могут работать значительно хуже, поэтому Pocket дообучает модели для таких условий. Количественные показатели улучшения не приводились.

Y Combinator Reportedly Uses Pocket to Record Interviews

Y Combinator currently uses Pocket to record its interviews, according to the account provided. The interview data is then sent to the organization’s online systems through Pocket APIs.

The same account contrasted this with an earlier workflow in which conference calls were recorded, sent to a human transcription service, and uploaded to Google Drive for keyword search. No further details were provided about the scale of Y Combinator’s Pocket use.

По имеющимся данным, Y Combinator использует Pocket для записи интервью

Y Combinator в настоящее время использует Pocket для записи интервью, согласно представленному сообщению. Затем данные интервью передаются в онлайн-системы организации через API Pocket.

В том же сообщении этот подход сравнивается с прежним workflow: записи конференц-звонков отправлялись в сервис человеческой транскрипции, а затем загружались в Google Drive для поиска по ключевым словам. Дополнительных сведений о масштабе использования Pocket в Y Combinator не приводится.

Aura positions itself as a consumer-safety platform for families

Aura operates in consumer security and safety, covering online risks including scams, spam and transaction fraud.

The platform also includes tools for families with teenage children to identify excessive device use and help guide them toward a digital detox. Its positioning combines fraud protection with digital safety and well-being.

Aura позиционирует себя как платформу потребительской безопасности для семей

Aura работает в сфере потребительской безопасности и защиты, охватывая онлайн-риски, включая мошенничество, спам и транзакционный фрод.

Платформа также предлагает семьям с детьми-подростками инструменты для выявления чрезмерного использования устройств и помощи в цифровом детоксе. Ее позиционирование объединяет защиту от мошенничества с цифровой безопасностью и благополучием.

AI tools linked to larger scams and heightened family identity-theft risks

A cited estimate said phishing email open rates rose from about 12% to roughly 60% in the AI era. The figure was not accompanied by a source or methodology.

The assessment also said the average size of some scams had grown from a few thousand dollars to about $25,000. Criminals are using AI tools for deepfakes and identity theft, while data on the dark web can serve as a basis for later attacks against families.

Children’s heavy device use and greater likelihood of posting personal information online were identified as an additional family risk.

ИИ связан с ростом ущерба от мошенничества и рисков кражи личности для семей

Согласно приведенной оценке, в эпоху ИИ доля открытий фишинговых писем выросла примерно с 12% до 60%. Источник и методология этого показателя не были указаны.

Также утверждалось, что средний размер некоторых мошеннических операций вырос с нескольких тысяч долларов примерно до $25 000. Злоумышленники используют инструменты ИИ для дипфейков и кражи личности, а данные из даркнета могут служить основой для последующих атак на семьи.

Дополнительным семейным риском назвали то, что дети много времени проводят с устройствами и чаще размещают личную информацию в интернете.

Identity-data leaks seen as an early warning of future identity theft

A breach at an identity-verification service may have exposed images of identification documents, while the earlier NPD breach involved Social Security numbers and other personal data. The scale of the more recent incident was described only approximately—as possibly affecting about half of U.S. residents—and was not confirmed with exact statistics. Repeated leaks can increase the future risk of actual identity theft, according to the assessment presented.

Aura says it uses a foundation model to analyze sequences of events, including data breaches and information appearing on the dark web, to assess risk. People are advised to monitor their credit, card numbers and statements without waiting for a full statement, and to watch for unusual physical mail as digital information is increasingly linked to physical crimes.

Утечки данных о личности рассматриваются как ранний сигнал будущей кражи личности

В результате взлома сервиса проверки личности могли быть раскрыты изображения удостоверений, тогда как более ранняя утечка NPD включала номера социального страхования и другие персональные данные. Масштаб более свежего инцидента описывался лишь приблизительно — как возможное затрагивание примерно половины жителей США — и не был подтвержден точной статистикой. Согласно представленной оценке, повторные утечки могут повышать будущий риск фактической кражи личности.

Aura заявляет, что использует foundation model для анализа последовательностей событий, включая утечки данных и появление информации в даркнете, чтобы оценивать риск. Пользователям рекомендуется следить за кредитной историей, номерами карт и операциями, не дожидаясь полной выписки, а также обращать внимание на необычную физическую почту, поскольку цифровая информация все чаще связана с физическими преступлениями.

Aura Builds Enterprise Security Around the Consumer–Workplace Overlap

Aura’s enterprise-security model is based on the view that the boundary between home and work has become blurred. The company sells its product to large enterprises and speaks with their CISOs, who report that protecting the enterprise increasingly requires accounting for employees’ consumer environments.

Aura argues that many enterprise scams and breaches begin on the consumer side and use employees as a channel for social engineering. It considers greater consumer awareness of these threats a potentially critical part of enterprise protection, although no specific enterprise products, contracts, or performance metrics were disclosed.

Aura строит корпоративную защиту вокруг пересечения потребительской и рабочей среды

Корпоративная модель Aura в сфере безопасности основана на том, что граница между домом и работой стала размытой. Компания продаёт свой продукт крупным предприятиям и общается с их CISO, которые отмечают: для защиты бизнеса всё чаще необходимо учитывать потребительскую среду сотрудников.

Aura утверждает, что многие корпоративные мошеннические схемы и утечки начинаются на потребительской стороне и используют сотрудников как канал социальной инженерии. Компания считает повышение осведомлённости потребителей об этих угрозах потенциально важной частью защиты предприятий; при этом конкретные продукты, контракты или показатели корпоративного направления не раскрыты.

Identity-security product uses a family graph to personalize onboarding

The company says it spends substantial time streamlining onboarding for identity and security products, where setting up accounts and using the product properly can be a hurdle. It treats time to value—how quickly a customer reaches something useful—as a major metric.

Its product places the family at the center and uses a “family graph” to map relationships among connected people. The company says its reasoning and inference systems use that context to build an end-to-end view of the customer, enabling more personalized onboarding and ongoing monitoring.

Продукт для защиты идентичности персонализирует онбординг с помощью семейного графа

Компания заявляет, что уделяет значительное время упрощению онбординга продуктов для защиты идентичности и безопасности: настройка аккаунтов и правильное использование продукта могут быть препятствием. В качестве важной метрики она рассматривает time to value — скорость, с которой клиент получает первую практическую пользу.

Продукт ставит семью в центр системы и использует «семейный граф» для отображения связей между людьми. По словам компании, ее системы рассуждения и вывода используют этот контекст, чтобы формировать целостное представление о клиенте и персонализировать онбординг и последующий мониторинг.

Company reports ARR of approximately $340 million-plus

The company says it has reached approximately $340 million-plus in annual recurring revenue (ARR).

The exact figure was not specified beyond that approximate range.

Компания сообщает о примерно $340 млн и более годовой регулярной выручки

Компания сообщает, что достигла примерно $340 млн и более годовой регулярной выручки (ARR).

Точная сумма не уточняется и обозначена лишь как приблизительная.

GPT-6 Astra announcement cites 99.9% ArcAGI-3 score

The GPT-6 Astra blog post is live on openai.com. Reported results include a 99.9% score on ArcAGI-3, described as especially striking, and a 64.6% score on Terminal Bench science at maximum reasoning effort, with a stated cost of $26.

GPT-6 Astra is also reported to have scored 0% on the Exploit Gym honeypot benchmark, where lower is better, alongside strong computer-use and exam performance. The launch was described as too recent and chaotic for a settled reaction; the benchmark methodology and context were not provided.

В анонсе GPT-6 Astra заявлен результат 99,9% в ArcAGI-3

Пост о GPT-6 Astra опубликован на openai.com. Среди заявленных результатов — 99,9% в ArcAGI-3, что было названо особенно впечатляющим, и 64,6% в научной части Terminal Bench при максимальном уровне рассуждений; указанная стоимость составила $26.

Также сообщается, что GPT-6 Astra получил 0% в бенчмарке-ловушке Exploit Gym, где более низкий результат лучше, а также показал высокие результаты в использовании компьютера и на экзаменационном тесте. Запуск сочли слишком свежим и хаотичным для окончательной оценки; методология и контекст бенчмарков не раскрыты.

Debate questions the value of Ed Zittrain’s long-running AI skepticism

Ed Zittrain is characterized as having been bearish on AI for a long time and approaching the three-year anniversary of his “bear posting.” The debate questions whether recurring pessimistic forecasts are useful, while noting that skepticism and optimism can vary over time.

Kevin Roose argues that anyone who has interviewed Zittrain or featured him in the name of AI skepticism has made their audience “dumber and less prepared” for what is coming. Eric Newcomer says Zittrain’s audience follows him. The evidence does not establish whether the criticism of Zittrain’s predictions is accurate; it also raises the view that continuing to make predictions despite being wrong may reflect persistence rather than confidence.

Дебаты поставили под вопрос ценность многолетнего скептицизма Эда Зитрейна в отношении ИИ

Эда Зитрейна характеризуют как давно настроенного скептически по отношению к ИИ; приближается трехлетняя годовщина его «медвежьих» прогнозов. В дебатах ставится вопрос о пользе регулярно повторяющихся пессимистичных прогнозов, при этом отмечается, что со временем скептицизм и оптимизм могут меняться.

Кевин Руз утверждает, что любой, кто брал интервью у Зитрейна или приглашал его ради скептического взгляда на ИИ, сделал свою аудиторию «глупее и менее подготовленной» к тому, что грядет. Эрик Ньюкомер говорит, что аудитория Зитрейна следует за ним. Представленные материалы не устанавливают, справедлива ли критика прогнозов Зитрейна; также высказывается мнение, что продолжение прогнозирования после ошибок может свидетельствовать скорее о настойчивости, чем об уверенности.

Jump builds a Shopify-like direct-to-consumer platform for sports fans

Jump, founded by Jordy with Mark Lore and Alex Rodriguez, has launched an in-house ticketing platform with the Minnesota Timberwolves. The system lets fans browse and buy tickets in the team’s app while giving the team access to customer data that is typically retained by third-party ticketing providers.

Jump’s proposed unified Timberwolves account would combine ticketing with merchandise, collectibles, concessions, parking, add-ons, content and media. The platform can use browsing, abandoned-cart and attendance data to send automated follow-ups and personalize sales or upsell offers, including to casual, single-game buyers.

The company frames the model as a Shopify-like direct-to-consumer relationship between teams and fans, arguing that tier-one sports lacks this kind of customer ownership. The evidence provides no quantified adoption, revenue or conversion results for Jump or the Timberwolves platform.

Jump строит Shopify-подобную direct-to-consumer-платформу для спортивных болельщиков

Jump, основанная Джорди совместно с Марком Лором и Алексом Родригесом, запустила внутреннюю билетную платформу с Minnesota Timberwolves. Система позволяет болельщикам искать и покупать билеты в приложении команды, а самой команде — получать доступ к данным клиентов, которые обычно остаются у сторонних билетных операторов.

Предлагаемый единый аккаунт Timberwolves должен объединить билеты с мерчандайзом, коллекционными товарами, едой и напитками, парковкой, дополнительными услугами, контентом и медиа. Платформа может использовать данные о просмотрах, брошенных корзинах и посещаемости для автоматических сообщений и персонализации продаж или дополнительных предложений, в том числе для случайных покупателей билетов на отдельные матчи.

Компания описывает эту модель как Shopify-подобные прямые отношения между командами и болельщиками и считает, что в спорте высшего уровня такого контроля над клиентскими отношениями не хватает. В источниках нет количественных данных о внедрении, выручке или конверсии Jump либо платформы Timberwolves.

Jump combines automated ticket pricing with open distribution across marketplaces

Jump is described as making sports-ticket pricing more automated across large inventories. In an arena with roughly 20,000 seats, including about 10,000 seats sold for at least 41 nights a year, changing supply and demand can otherwise require frequent manual price updates. The stated aim is to protect revenue or lower prices for selected games to help fill seats.

Tickets placed on Jump can also be distributed through Ticketmaster TM+, SeatGeek, StubHub and other secondary markets, giving more buyers access to the same inventory and potentially raising prices when demand is strong. The model is presented as giving teams control over distribution rather than leaving each marketplace to keep tickets within its own system. It also reflects the prediction that AI will have a major effect on sports.

Jump объединяет автоматизированное ценообразование билетов с открытой дистрибуцией на маркетплейсах

Jump, как описывается, делает ценообразование спортивных билетов более автоматизированным при работе с большими объёмами мест. На арене примерно с 20 000 мест, из которых около 10 000 продаются как минимум на 41 матч в год, меняющийся спрос и предложение в противном случае требуют частого ручного обновления цен. Заявленная цель — сохранять выручку или снижать цены на отдельные матчи, чтобы помогать заполнять арену.

Билеты, размещённые на Jump, также могут распространяться через Ticketmaster TM+, SeatGeek, StubHub и другие вторичные рынки, предоставляя большему числу покупателей доступ к одному и тому же предложению и потенциально повышая цены при высоком спросе. Эта модель представлена как способ дать командам контроль над дистрибуцией, вместо того чтобы каждый маркетплейс удерживал билеты внутри собственной системы. Она также отражает прогноз, что ИИ окажет значительное влияние на спорт.

Portal Space Systems develops maneuverable spacecraft for defense and exploration

Portal Space Systems’ founder says the company is developing highly maneuverable spacecraft for defense, describing them as “fighter jets for orbit,” while also aiming to support NASA and civil-space exploration. He argues that many spacecraft are too predictable and constrained by limited fuel in an increasingly competitive orbital environment.

The company has about 60 employees north of Seattle, according to its founder. Portal launched its first mission to orbit in March to test electronics hardware and has completed a roughly 600-pound Starburst spacecraft scheduled to launch on October 19 to demonstrate some of the company’s capabilities.

The founder expects more companies to build significant defense-related businesses as government agencies become more willing to partner with industry and acquisition reforms seek to deliver capabilities faster. He also expects some national-security space activity to remain undisclosed.

Portal Space Systems разрабатывает маневренные космические аппараты для обороны и исследований

Основатель Portal Space Systems заявил, что компания разрабатывает высокоманевренные космические аппараты для обороны, описывая их как «истребители для орбиты», а также стремится поддерживать NASA и гражданские космические исследования. По его мнению, многие космические аппараты слишком предсказуемы и ограничены запасом топлива в условиях растущей конкуренции на орбите.

По словам основателя, в компании, расположенной к северу от Сиэтла, работает около 60 человек. В марте Portal вывела на орбиту свою первую миссию для испытания электронной аппаратуры и завершила создание космического аппарата Starburst массой примерно 600 фунтов, запуск которого запланирован на 19 октября для демонстрации ряда возможностей компании.

Основатель ожидает, что всё больше компаний будут развивать значительный оборонный бизнес по мере того, как государственные ведомства охотнее сотрудничают с индустрией, а реформы закупок ускоряют передачу возможностей военным. Он также ожидает, что часть космической деятельности, связанной с национальной безопасностью, останется нераскрытой.

Base10 Bets on Hundreds of Millions of AI Models

Base10 is betting that the number of AI models will grow from the roughly five million models believed to be trained on Hugging Face to hundreds of millions.

The forecast envisions a mix of powerful closed-source frontier models and a much larger number of open or specialized models—possibly one model per person, or even dozens per person. It remains uncertain whether that future will bring one model for each person or several.

Base10 делает ставку на сотни миллионов ИИ-моделей

Base10 делает ставку на рост числа ИИ-моделей — примерно с пяти миллионов, которые, предположительно, обучены на Hugging Face, до сотен миллионов.

Прогноз предполагает сочетание мощных закрытых frontier-моделей и гораздо большего числа открытых или специализированных моделей — возможно, по одной модели на человека или даже по нескольку десятков. При этом остаётся неопределённым, появится ли в будущем одна модель на каждого человека или несколько.

Open and closed AI labs are largely scaling the same training recipe

An assessment of current model development says there is little difference between OpenAI’s reinforcement-learning stack, Chinese open-source efforts and American open-source projects. The approach first scaled pre-training and model size and is now scaling reinforcement learning (RL).

The view is that labs will continue scaling RL, on the bet that it will produce higher levels of intelligence and enable more economically useful tasks. Continual learning is also identified as an important priority.

Открытые и закрытые ИИ-лаборатории в основном масштабируют один и тот же рецепт обучения

Согласно оценке текущего развития моделей, между стеком reinforcement learning OpenAI, китайскими open-source-разработками и американскими open-source-проектами существует мало различий. Сначала масштабировались предварительное обучение и размер моделей, а теперь масштабируется reinforcement learning (RL).

Ожидается, что лаборатории продолжат масштабировать RL, рассчитывая на достижение более высоких уровней интеллекта и выполнение большего числа экономически полезных задач. Отдельно важным приоритетом называется непрерывное обучение.

BaseLabs announces long-term research into personal continual learning

BaseLabs announced a longer-term research direction focused on continual learning. The project envisions an open-source model that organically adapts to information about a specific company, team or individual, rather than relying only on external memory files.

This approach is presented as distinct from the update cycle used by large labs such as OpenAI and Anthropic: they train a model, release it, collect feedback and build reinforcement-learning environments to address gaps. BaseLabs argues that personal continual learning could unlock new architectural or product paradigms, although which approaches will prove viable remains uncertain.

BaseLabs объявила о долгосрочном исследовании персонального continual learning

BaseLabs объявила о долгосрочном исследовательском направлении, посвящённом continual learning. Проект предполагает, что открытая модель будет органично адаптироваться к информации о конкретной компании, команде или человеке, а не полагаться только на внешние файлы памяти.

Этот подход противопоставляется циклу обновления моделей, который используется крупными лабораториями, такими как OpenAI и Anthropic: они обучают модель, выпускают её, собирают обратную связь и создают среды reinforcement learning для устранения пробелов. По оценке BaseLabs, персональный continual learning может открыть новые архитектурные или продуктовые парадигмы, однако пока неясно, какие именно подходы окажутся жизнеспособными.

AI models may be better judged by task-specific utility thresholds

An analysis proposes evaluating large language models by whether they clear the intelligence threshold required for a particular task, rather than by a single absolute ranking. Below that threshold, the task cannot be completed; above it, additional intelligence brings sharply diminishing returns.

Closed-source models are said to reach these thresholds first, while open-source models may catch up roughly six to nine months later, though the delay varies by task. Once the threshold is reached, many economically valuable applications may favor open models for control and task-specific improvement, while frontier science and mathematics retain highly inelastic demand for maximum intelligence.

AI product companies are expected to use user feedback to improve models for the tasks they prioritize, rather than remain wrappers around other models. The ecosystem is still described as too immature for most companies to train such models independently, but this could become more common over time.

Модели ИИ могут эффективнее оцениваться по порогам полезности для конкретных задач

В рамках анализа предлагается оценивать большие языковые модели по тому, достигают ли они порога интеллекта, необходимого для конкретной задачи, а не по единому абсолютному рейтингу. Ниже этого порога задачу выполнить нельзя, а выше него дополнительный интеллект дает резко убывающую отдачу.

По этой оценке, закрытые модели обычно достигают нужных порогов первыми, тогда как открытые могут догонять их примерно через шесть—девять месяцев, хотя задержка зависит от задачи. После достижения порога многие экономически ценные приложения могут предпочесть открытые модели ради контроля и специализированного улучшения; при этом для передовой науки и математики спрос на максимальный интеллект остается крайне неэластичным.

Ожидается, что компании, создающие ИИ-продукты, будут использовать отзывы пользователей, чтобы улучшать модели под приоритетные задачи, а не оставаться оболочками над чужими моделями. Экосистема пока считается недостаточно зрелой, чтобы большинство компаний самостоятельно обучали такие модели, но со временем это может стать более распространенным.

BaseLabs considers open RL environments to help close the gap with major labs

BaseLabs says its mandate is to make open-source models—and eventually possibly closed-source models—as useful as possible. Alongside aggregating compute, it is considering aggregating data and creating complex reinforcement-learning environments for the open community.

The project estimates that closed-source labs spend billions of dollars a year on RL environments. BaseLabs says it has spent the past few years making environments for individual users and is considering releasing them for everyone, so open- and closed-source providers can train on them. It remains unclear whether BaseLabs can create environments comparable to those of major labs, or whether distillation and accessible data alone can close the gap.

BaseLabs рассматривает открытые RL-среды как способ сократить отставание от крупных лабораторий

BaseLabs заявляет, что его задача — сделать открытые модели, а в перспективе, возможно, и закрытые модели максимально полезными. Помимо агрегации вычислений, проект рассматривает агрегацию данных и создание сложных сред для обучения с подкреплением для открытого сообщества.

По оценке проекта, закрытые лаборатории тратят на RL-среды миллиарды долларов в год. BaseLabs сообщает, что последние несколько лет создавала среды для отдельных пользователей и рассматривает возможность выпустить их для всех, чтобы на них могли обучаться открытые и закрытые поставщики. Пока неясно, сможет ли BaseLabs создать среды, сопоставимые со средами крупных лабораторий, и достаточно ли дистилляции и доступных данных, чтобы сократить разрыв.

Model Values Become a Distinct AI-Development Challenge

As open-source models approach closed systems in capabilities and economically valuable tasks, the values embedded in models are becoming a separate development challenge. Values, ethics and morality are shaped—implicitly or explicitly—through pre-training, mid-training, post-training, classifiers and safety systems.

The unclear values of Chinese open-source models are cited as one reason many American companies are reluctant to use them. A key unresolved research question is whether model values can be organically shaped for a country, company or individual, including through possible “post-post-training.”

Trust in benchmarks is described as being at an all-time low and potentially declining further, complicating how the value of new models should be communicated.

Ценности моделей становятся отдельной проблемой разработки ИИ

По мере того как открытые модели приближаются к закрытым по своим возможностям и экономически ценным задачам, заложенные в них ценности становятся отдельной проблемой разработки. Ценности, этика и мораль формируются — прямо или косвенно — на этапах предварительного, промежуточного и последующего обучения, а также классификаторами и системами безопасности.

Неясность ценностей китайских открытых моделей называется одной из причин, по которым многие американские компании не хотят их использовать. Важный нерешённый исследовательский вопрос — можно ли органично формировать ценности модели под страну, компанию или отдельного человека, в том числе с помощью возможного «пост-пост-обучения».

Доверие к бенчмаркам, как отмечается, находится на исторически низком уровне и может продолжить снижаться, что усложняет коммуникацию ценности новых моделей.

BaseLabs advocates evaluating AI models through real-world economic use

BaseLabs argues that conventional AI benchmarks often target narrow failure modes. ArcAGI is cited as an example of a specialized area where models historically performed poorly; once a benchmark is public, it can also become a target for reinforcement learning and lose some independence.

The company says there is no set of 10 benchmarks that can fully capture a model’s strengths and uneven frontier. In its view, the strongest signal comes from aggregating evaluations built by companies using models for real, paid tasks. BaseLabs says its thousands of users and scaled RL environments can provide that signal, while acknowledging there is no universal measure of model usefulness.

BaseLabs предлагает оценивать ИИ-модели по реальному экономическому использованию

BaseLabs считает, что традиционные бенчмарки ИИ часто проверяют узкие типы ошибок. ArcAGI приводится как пример специализированной области, в которой модели исторически показывали слабые результаты; после публикации бенчмарк также может стать целью обучения с подкреплением и частично утратить независимость.

Компания утверждает, что набора из 10 бенчмарков недостаточно для полного описания сильных сторон и неровного профиля возможностей модели. По ее мнению, наиболее надежный сигнал дает объединение оценок, созданных компаниями для реальных оплачиваемых задач. BaseLabs заявляет, что ее тысячи пользователей и масштабируемые RL-среды могут предоставить такой сигнал, признавая при этом отсутствие универсального способа измерить полезность модели.

Continual learning remains a pre-paradigm field as researchers explore new compaction methods

Continual learning remains a “pre-paradigm” field, with no agreed definition. Some approaches treat it as searching and organizing information in a context window, while others require updating the model with every token; the latter can damage the model in different ways.

Compaction is described as a comparatively mature practice in OpenAI’s Codex and Anthropic’s Claude Code, where summarizer models currently perform the compression. More advanced neural compactors operating in KB-cache space may be possible, but much of the relevant research remains inside closed-source labs.

BaseLabs positions itself as an effort to move this work into the open without the pressure to release the best model in the current quarter. The analysis predicts that research into compaction and continual learning could make the field a more systematic science.

Continual learning остаётся допарадигмальной областью на фоне поиска новых методов компактизации

Continual learning остаётся «допарадигмальной» областью: общепринятого определения нет. Одни подходы рассматривают его как поиск и организацию информации в контекстном окне, другие требуют обновлять модель на каждом токене; последнее может по-разному повреждать модель.

Компактизация описывается как сравнительно зрелая практика в Codex от OpenAI и Claude Code от Anthropic, где сжатие сейчас выполняют модели-суммаризаторы. Возможны более продвинутые нейронные компакторы, работающие в пространстве KB-кэша, однако значительная часть соответствующих исследований остаётся внутри закрытых лабораторий.

BaseLabs позиционирует себя как проект, стремящийся вынести эту работу в открытую среду без давления выпустить лучшую модель в текущем квартале. Согласно анализу, исследования компактизации и continual learning могут превратить область в более систематическую науку.

Continual Learning Remains Unresolved for Everyday AI Systems

For frontier AI labs, continual learning may be achievable through a faster version of the existing training cycle: collecting data, building reinforcement-learning environments and retraining models. The analysis suggests that larger models could make architectural improvements, reduce pre-training loss and generate RL environments at scale as compute increases.

That approach does not solve continual learning for ordinary AI-native startups, enterprises or specialized agents. A legal-associate agent trained on a firm’s complex relationships and implicit practices may degrade under supervised fine-tuning, while reinforcement learning may not provide knowledge acquisition in the needed way. The problem remains without a satisfactory answer, and its assessment depends on how continual learning is defined and which application is considered.

Continual learning остаётся нерешённым для повседневных AI-систем

Для передовых AI-лабораторий continual learning может быть достигнут за счёт ускорения уже существующего цикла обучения: сбора данных, создания сред для обучения с подкреплением и переобучения моделей. Согласно анализу, по мере роста доступных вычислений более крупные модели смогут совершенствовать архитектуру, снижать ошибку на этапе предварительного обучения и самостоятельно создавать RL-среды в большом масштабе.

Однако такой подход не решает проблему continual learning для обычных AI-native стартапов, предприятий и специализированных агентов. Агент-юрист, которого обучают сложным связям и неявным практикам фирмы, может деградировать при supervised fine-tuning, а reinforcement learning может не обеспечивать нужное усвоение знаний. Удовлетворительного решения пока нет; оценка проблемы зависит от того, как определяется continual learning и для какого применения он рассматривается.

Snowflake explores partnerships with rapidly scaling AI startups

Snowflake is spending significant time meeting startups and established companies about AI opportunities and potential partnerships. The company is also working with its product and engineering teams on new ideas as AI makes software easier to create, according to the source.

The source describes a startup that was less than three months old and already had dozens of customers using its platform for reinforcement learning; the meeting reportedly took place “the day before yesterday,” though the timing was uncertain. Snowflake discussed how the companies could partner, while noting that AI ideas can move rapidly from concept to prototype, product feature and adoption by many customers.

Snowflake изучает партнерства с быстрорастущими ИИ-стартапами

Snowflake уделяет значительное время встречам со стартапами и устоявшимися компаниями, обсуждая возможности применения ИИ и потенциальные партнерства. Компания также работает с продуктовыми и инженерными командами над новыми идеями, поскольку ИИ упрощает создание программного обеспечения, говорится в источнике.

В источнике описан стартап, существующий менее трех месяцев и уже имеющий десятки клиентов, использующих его платформу для обучения с подкреплением; встреча, вероятно, состоялась «позавчера», хотя точные сроки не определены. Snowflake обсуждала возможное партнерство, отмечая, что идеи в сфере ИИ могут быстро пройти путь от концепции до прототипа, функции продукта и широкого клиентского внедрения.

Snowflake shifts growth focus from headcount to AI leverage

Snowflake is stressing that scale is no longer primarily about adding people, as AI can automate many tasks that previously required individuals. The company says judgment, effectiveness and the ability to define how work gets done matter more than organizational size as measures of growth.

Some functions are expected to expand, particularly those interacting with the external world, such as account executives serving customers with significant spending. Other areas, including engineering, may gain substantial leverage from agentic AI. Snowflake also continues to hire young employees with AI-native perspectives.

The company sees experimentation by small teams as a major organizational challenge. CoCo was described as a breakout success whose team had no more than five people for much of its existence and remains tiny.

Snowflake смещает фокус роста с численности на использование ИИ

Snowflake подчёркивает, что масштаб компании больше не определяется прежде всего ростом штата: ИИ может автоматизировать многие задачи, которые раньше требовали участия людей. Компания считает, что мерой роста должны в большей степени служить качество решений, эффективность и способность определять способы выполнения работы, а не размер организации.

Ожидается рост некоторых функций, прежде всего связанных с внешним миром, например аккаунт-менеджеров, работающих с клиентами, которые тратят значительные суммы. В других областях, включая разработку, агентный ИИ может обеспечить существенный прирост эффективности. Snowflake также продолжает нанимать молодых сотрудников с ИИ-ориентированным мышлением.

Компания считает одной из главных организационных задач создание условий для экспериментов малых команд. CoCo назвали выдающимся успешным проектом: большую часть времени над ним работало не более пяти человек, и сейчас команда остаётся очень небольшой.

Snowflake Develops Internal “Enterprise Brain” for Company Knowledge

Snowflake is working on an internal “Enterprise Brain” project designed to capture relevant knowledge about company activities and route the right information to the right employees. The company’s internal information exchange remains a work in progress.

The approach is intended to reduce unnecessary meeting attendance: employees who have nothing to contribute should read meeting notes instead. AI could also facilitate routine reporting on completed work and may substantially change management spans and reporting relationships, although Snowflake has not recently measured whether internal meeting time is increasing or decreasing.

Snowflake разрабатывает внутренний Enterprise Brain для обмена знаниями

Snowflake работает над внутренним проектом «Enterprise Brain», который должен собирать важные сведения о деятельности компании и направлять нужную информацию соответствующим сотрудникам. Внутренний обмен информацией в компании пока остается незавершенной задачей.

Этот подход призван сократить ненужное присутствие на встречах: сотрудникам, которым нечего добавить, предлагается читать протоколы. ИИ также может упростить регулярную отчетность о выполненной работе и существенно изменить масштабы управления и подчиненности, хотя Snowflake недавно не измеряла, увеличивается или сокращается время внутренних встреч.

Snowflake plans for AI capability jumps while optimizing model and token costs

Snowflake expects future jumps in AI capabilities could increase spending, while cheaper models, open-source systems and efficiency improvements may reduce costs. The company considers AI token spending worthwhile when it produces real business results, but prioritizes product creation and customer adoption over minimizing token use at all costs.

To control spending, Snowflake optimizes default model selection and task graphs, assigning simpler tasks to less expensive models. It is also using an AI Gateway to make model access more efficient and experimenting with open-weight models through its CoCo harness. Support and site-reliability teams process tens of thousands of alerts daily, making those workflows a significant opportunity for token optimization.

Snowflake готовится к скачкам возможностей ИИ и оптимизирует выбор моделей и расходы на токены

В Snowflake ожидают, что будущие скачки возможностей ИИ могут увеличить расходы, хотя более дешёвые модели, системы с открытым исходным кодом и повышение эффективности способны их сократить. В компании считают затраты на токены оправданными, когда они дают реальные бизнес-результаты, но ставят создание продуктов и их внедрение клиентами выше попыток минимизировать расход токенов любой ценой.

Для контроля расходов Snowflake оптимизирует выбор моделей по умолчанию и графы задач, передавая более простые операции менее дорогим моделям. Компания также использует AI Gateway для повышения эффективности доступа к моделям и экспериментирует с моделями с открытыми весами через собственный инструментарий CoCo. Команды поддержки и обеспечения надёжности обрабатывают десятки тысяч предупреждений в день, что создаёт значительные возможности для оптимизации токенов.

Snowflake Prioritizes Enterprise AI Outcomes Over Model Routing

Snowflake is positioning its AI strategy around broad enterprise deployment and business outcomes rather than model routing alone. The company says Cowork deployments are reaching thousands of users within companies, while it aims to expand adoption of Cowork among employees and CoCo among data engineers.

Snowflake’s Gateway is designed to provide model access alongside governed access to enterprise tools and applications, including MCP tools. The company is also experimenting with security solutions for agent trajectories to help prevent model misuse.

Snowflake views model routing as a useful infrastructure capability, but considers delivering value from customers’ important data the larger opportunity.

Snowflake ставит бизнес-результаты корпоративного ИИ выше маршрутизации моделей

Snowflake строит свою ИИ-стратегию вокруг широкого корпоративного внедрения и бизнес-результатов, а не только маршрутизации моделей. Компания сообщает, что внедрения Cowork уже охватывают тысячи пользователей внутри отдельных компаний; при этом она стремится расширить использование Cowork среди сотрудников, а CoCo — среди инженеров по работе с данными.

Gateway от Snowflake должен обеспечивать доступ к моделям, а также регулируемый доступ к корпоративным инструментам и приложениям, включая MCP-инструменты. Компания также экспериментирует с решениями для безопасности траекторий действий агентов, чтобы предотвращать неправомерное использование моделей.

Snowflake считает маршрутизацию моделей полезной инфраструктурной возможностью, но видит более крупную перспективу в создании ценности на основе важных данных клиентов.

Snowflake cites Natoma acquisition as example of its data-and-AI strategy

Snowflake says it evaluates acquisitions by whether bringing a company into the business will accelerate its mission as a data and AI platform. The company describes its strength as helping customers derive insights and drive actions from important data.

Snowflake calls its acquisition of Natoma a strong example of that approach. It says MCP is increasingly important because it can provide real-time context from communications such as Slack and email directly within the AI harness, benefiting Snowflake and its customers.

Snowflake назвала приобретение Natoma примером своей стратегии в области данных и ИИ

Snowflake заявляет, что оценивает приобретения по тому, ускорит ли присоединение компании ее миссию как платформы данных и ИИ. Компания считает своей сильной стороной помощь клиентам в получении выводов и принятии решений на основе важных данных.

Snowflake называет приобретение Natoma ярким примером такого подхода. Компания заявляет, что MCP становится все более важным, поскольку может предоставлять контекст в реальном времени из таких коммуникаций, как Slack и электронная почта, непосредственно в ИИ-хранилище, принося пользу Snowflake и ее клиентам.

Lex Speedman Speeds Up Lex Fridman’s Podcast Speech to 2x

A product called Lex Speedman, available at lexspeedman.com, accelerates Lex Fridman’s speech to 2x speed while keeping his guest at 1x.

Its creator, Mario Dion, said he built the tool because he wanted to watch an episode with DHH but found Fridman speaking too slowly. The product is described as cutting up to 20% from an episode, although it is uncertain how much of a typical episode Fridman spends speaking.

Lex Speedman ускоряет речь Лекса Фридмана в подкасте вдвое

Продукт Lex Speedman, доступный на сайте lexspeedman.com, ускоряет речь Лекса Фридмана в 2 раза, оставляя скорость речи его гостя на уровне 1x.

Создатель инструмента Марио Дион сообщил, что разработал его, поскольку хотел посмотреть выпуск с DHH, но считал, что Фридман говорит слишком медленно. Утверждается, что продукт сокращает продолжительность выпуска максимум на 20%, однако неизвестно, какую долю обычного выпуска Фридман занимает своей речью.

Astra GPT-6 Called New State of the Art on ARC AGI-3, but AGI Evidence Is Lacking

Astra GPT-6 was announced as released. In a video, Matt Schumer reportedly created a game in Unreal Engine in a single pass; the engine’s MCP support is described as enabling game development through conversation with the model.

Mike at ARC called Astra the new state of the art on ARC AGI-3 and a qualitatively large step toward AGI, saying the pace of progress was surprising. ARC nevertheless says there is not yet enough evidence to classify Astra as AGI.

Open-ended invention remains an unsolved gap relative to human capabilities and could become the basis for ARC AGI-4, potentially requiring the creation of new science or physics.

Astra GPT-6 назвали новым передовым результатом на ARC AGI-3, но доказательств AGI пока недостаточно

О релизе Astra GPT-6 было заявлено. В видео Мэтт Шумер, как утверждается, за один проход создал игру в Unreal Engine; поддержка MCP в движке, по описанию, позволяет разрабатывать игры посредством общения с моделью.

Майк из ARC назвал Astra новым передовым результатом на ARC AGI-3 и качественно большим шагом к AGI, отметив удивительный темп прогресса. При этом ARC заявляет, что доказательств для классификации Astra как AGI пока недостаточно.

Открытое изобретательство остаётся нерешённым пробелом по сравнению с человеческими возможностями и может стать основой ARC AGI-4, потенциально потребовав создания новой науки или физики.

Privacy ·