Super Intelligence Minds

Search

from: 2026-01-01 ✕

6,354 passages, newest first · 617 ms

Anton Gladkov2026-08-0901-market-scansource ↗context

Это ровно то что мне нужно для того чтобы в ближайшем будущем зарелизить мой self-serve SLSBMB AI, к чему я так яростно стремлюсь последние несколько месяцев.

Сказать что я неоднократно запускал тесты на разные модели чтобы понять на каких моделях маркет скан отрабатывает лучше всего - ничего не сказать. Думаю что я спалил десятки миллиардов токенов на эти эксперименты.

Anton Gladkov2026-08-0901-market-scansource ↗context

В пике безумие доходило до того что один маркет скан ДЛЯ ОДНОГО ПРОДУКТА использовал ~290-500 ПОСЛЕДОВАТЕЛЬНЫХ СЕССИЙ БЛЯДЬ. Рекордный такой ран занимал изи 2.5 дня.

В итоге мне удалось зарефайнить макулатуру на которой живет маркет скан и все раны таким образом, что достаточно 4 последовательных сессий: Research (до 50 минут), Writer (до 50 минут), Market Arms (как называются…

Anton Gladkov2026-08-0901-market-scansource ↗context

Я уже сказал что я делаю конкретно эту систему несколько месяцев, и она выпила всю мою кровь, а так же сперму, пропитку тканей слезных желез, и секрет простаты.

Я занимаюсь этим круглосуточно, и меня это порядком заебало.

Anton Gladkov2026-08-0901-market-scansource ↗context

Но я не сдаюсь.

И вот сегодня я получил колоссальные результаты, и осталось В КОТОРЫЙ СУКА РАЗ провести эксперимент не на конкретном сете моделей в которые я верю, а на разных моделях, и сравнить каждый сегмент меж собой, чтобы понять какой из раннеров пускать на какой модели для максимальной комбинаторной эффективности.

Anton Gladkov2026-08-0901-market-scansource ↗context

По-сути мне надо было просто прогнать весь маркет скан (все 4 его сессии) на каждой из моделей, несколько раз, и получить средние значения, которые можно будет считать репрезентативными.

Опять же, поскольку я это делаю не первый и не третий десяток раз, я думаю что результат реально репрезентативный, а не то что "кто-то что-то сделал и посчитал это…

Anton Gladkov2026-08-0901-market-scansource ↗context

Я бы хуйню вам рандомную после таких мучений показывать не стал, потому что мне потом еще отвечать за это когда я начну кому-то из вас продавать этот солюшен за сука филки;))))))

Следующим сообщением прилетит обезличенный но достаточный для понимания разницы между моделями в креативном поле итог этого гигантского теста, который занял весь сегодняшний день. Вы увидите средние значения за…

Anton Gladkov2026-08-0901-market-scansource ↗context

Единственное что я не смогу вам показать - это Fable 5 и Opus 5, поскольку их уже нет в моем ростере, но я не грущу по ним абсолютно, поскольку я уже и так знаю на базе ДЕСЯТКОВ экспериментов как бы они себя показали. Fable показал бы себя хуже чем Opus. Fable вообще весьма посредственен на текущем поле в вопросах глубины креатива…

Anton Gladkov2026-08-0901-market-scansource ↗context

Я в итоге конкретно по Writing юзаю QWEN3.8MAX с фоллбеком на GPT 5.5 xhigh, где фоллбек хитрый - они обе будут всегда писать контент, просто судья должен будет выбрать из двух, и в 30% случаев он выбирает 5.5 xhigh, что невероятно крутой результат для модели которой уже много месяцев.

Anton Gladkov2026-08-0901-market-scansource ↗context

Ну а лидера по остальным критериям я думаю вы легко увидите. Многие думают что Fable конкурент Sol, но в рисеч задачах Fable показывает В 5 И БОЛЕЕ РАЗ ниже цифры чем Sol. На моих этих вот креативных задачах это просто факт. Fable рядом с Kimi. Sol Max где-то в космосе.

Anton Gladkov2026-08-0901-market-scansource ↗context

Еще бы эта пизда умела кодить без ухода в безумие, цены бы не было. На рисеч и райтинг задачах Sol Max удивительным образом не уходит в безумие. Он реально сам доделывает всю работу и закругляется за 50 минут (против 17 минут 5.5 xhigh). На кодинговых задачах он не закругляется в целом никогда, во всяком случае я ни разу не…

Anton Gladkov2026-08-0901-market-scansource ↗context

Я понимаю что нихуя не понятно из текста выше, но это потому что вы не утрудились скормить это своей GPT или Claude и поговорить об этом =)

GPT 5.5 xhigh находит 26 гипотез там где GPT 5.6 Sol Max находит 28, что говорит о том что GPT 5.5 xhigh невероятная модель всё еще на сегодняшний день, однако…

Anton Gladkov2026-08-0901-market-scansource ↗context

А маркет скан нет смысла делать снова и снова - ты его делаешь раз в жизни чтобы запланировать работу на весь следующий год.

То бишь GPT 5.5 Xhigh дает тебе по тем же гипотезам Total Addressible Market capacity ~ в 4-5раз ниже чем GPT 5.6 Sol Max.

Anton Gladkov2026-08-0901-market-scansource ↗context

И все это стоит просто лишних 20-30 минут заебистого рассуждения модели.

Вы не в моей нише, поэтому вы не понимаете насколько это важно, но это блядь важно просто шо пиздец)

И другие цифры там есть веселые которые можно трактовать занятным образом, оставляю вас гадать на них. Когда я релизну свой продукт я думаю все в итоге объяснится его же…

Anton Gladkov2026-08-0901-market-scansource ↗context

Резюмируя: в мелочах кажется что модели недалеко друг от друга ушли, но правда в том что GPT 5.6 Sol Max ушел от GPT 5.5 xhigh настолько далеко, что он выдает в бизнес выражении контента за лишние 15 минут рассуждения как разница между 1 годом и 10 годами скурпулезной работы отдела продаж по рисечу.

Anton Gladkov2026-08-0901-market-scansource ↗context

Это реально кроме шуток ускорение отдела продаж в 8 раз на десятилетнем отрезке, за лишние 20 минут копеечного палева токенов.

Это сравнение для самых маленьких. Если там копаться в деталях, мы легко найдем ещё бОльшее ускорение, а так же вещи которые предыдущими моделями просто в принице были недостижимы, типа определенных игрищ текстовыми конструкциями, но сегодня нет сил расписывать это)

Anton Gladkov2026-08-0901-market-scansource ↗context

Market Scan Model Benchmark - Human Scorecard

Generated: 2026-08-08T22:35:20.254Z

Run directory: /Users/antongladkov/.codex/worktrees/SLSBMB-Sender/market-scan-model-benchmark/var/market-scan-model-benchmark/20260808T201848Z-market-scan-model-benchmark

Anton Gladkov2026-08-0901-market-scansource ↗context

## Scope

This is an offline sidecar benchmark for model interchangeability on Market Scan writer work. It used production PostgreSQL client/project/input rows exported read-only, plus the current writer-visible Market Scan doctrine from this repo. It did not mutate production, queues, providers, or customer-facing state. It also did not run the production Kimi judge or paid/provider…

Anton Gladkov2026-08-0901-market-scansource ↗context

## Bottom Line

- Keep Qwen3.8 max as the production-safe baseline until a separate code change implements stage-specific model routing. The current production path is intentionally fail-closed there.
- Use GPT 5.6 Sol Max for research expansion and maximum sourcing-map breadth. It found the widest segment/arms universes on every client, but it is slower and can…

Anton Gladkov2026-08-0901-market-scansource ↗context

## Recommended Model Routing

| Market Scan phase | Primary | Fallback | Why |
|---|---|---|---|
| Research map / adjacent discovery | GPT 5.6 Sol Max | GPT 5.5 xhigh | Sol produced the broadest segment maps on all three clients; GPT 5.5 is the faster, more controlled fallback. |
| Sourcing arms before…

Anton Gladkov2026-08-0901-market-scansource ↗context

## Aggregate Matrix

| Model | Completed | Avg min | Segments | Arms | Packs | Touches | Arms / segment | Note |
|---|---:|---:|---:|---:|---:|---:|---:|---|
| Qwen3.8 max | 3/3 | 41.1 | 50 | 575 | 50 | 250 | 11.5 | Production-safe baseline; conservative, doctrine…

More