runesleo

vip
Возраст 8.5 год
Максимальный уровень 6
Пока нет содержимого
Недавно я заново пересобрал маршрутизацию между несколькими моделями, добавив явные downgrade-уведомления и gate для ручных действий. Цель — чтобы система, даже если модель начнёт сбоить, оставалась управляемой.
В день, когда 2026-07-16 официально раскрыли на Hugging Face журналы атаки — более 17 000 записей — я внезапно обнаружил, что сам маршрут самохостингового анализа в тот день вообще не проверялся: я не удостоверился, что он может работать в аварийный момент.
Команда Hugging Face сначала прогнала эти логи через передовые модели из коммерческого API. В итоге реальные команды атак, полезна
Посмотреть Оригинал
  • Награда
  • комментарий
  • Репост
  • Поделиться
Пять дней назад я привязал все четыре «потока» — Claude, Codex, Cursor и Grok — к самым мощным моделям и включил самый высокий уровень рассуждений. Идея была такая: раз я заплатил, значит нужно выжать из этого максимум.
Через пять дней выяснилось, что это просто не тянет. Лимиты падают слишком быстро: самая мощная модель уходит на повторяющиеся проверки и форматирование — по сути, это пустая трата.
Теперь я поменял схему: распределяю по плотности суждений. Для задач, где ошибки могут стоить денег или загрязнить данные — проверки, кросс-верификацию, задачи по стратегии средств — продолжаю остав
Посмотреть Оригинал
post-image
  • Награда
  • комментарий
  • Репост
  • Поделиться
Многие, увидев, что реальные события уже закончились, а заголовки на рынке написаны предельно ясно, даже когда цена отображается близко к 0 или 1, решают, что рынок Polymarket уже окончательно урегулирован.
Эти сигналы сами по себе на самом деле не доказывают, что рынок уже окончательно закрыт. Заголовок — это лишь описание вопроса, а показанная цена — только отражение текущего состояния рынка.
Моё правило для входа в дверь — оставить всего одну фразу: сначала пройдите эти шесть вопросов. Если по любому пункту неясно — пропускайте этот рынок.
1. Rules — что именно спрашивают.
Заголовок только
Посмотреть Оригинал
  • Награда
  • комментарий
  • Репост
  • Поделиться
Я передал один и тот же UI‑запрос одной и той же модели и прогнал его 9 раз: без Skill, apple-design, ui-ux-pro-max — по 3 раза каждое.
Результат заставил меня поменять способ оценки: одна и та же связка Skill может один раз сработать отлично, а в другой раз — провалиться.
После анонимизации 9 результатов и передачи их на независимую оценку двум людям средние баллы по трём группам составили:
apple-design 91,3
ui-ux-pro-max 89,0
без Skill 85,8
Но ни одна группа не набрала 3/3 без единого дефекта.
В apple-design и без Skill по одному разу «пережало» главную кнопку в экране с деталями телефона; в
Посмотреть Оригинал
post-image
  • Награда
  • комментарий
  • Репост
  • Поделиться
Самый опасный сбой в AI‑воркфлоу — не то, что сразу появляется ошибка.
Проблема в том, что отвалилась основная модель, а резервная тоже не сработала, но система всё равно выдаёт фрагмент, который выглядит как полностью готовый результат — и человеку кажется, что работа завершена.
Я наступал на это один раз: при ежедневной обработке информации основная модель проработала только до 60 секунд и была обрублена, резервная тоже не сработала, а в итоге всё равно получилась вполне достойно выглядящая извлечённая разметка. Дело не в том, что нужно «поменять маршрут и продолжить попытки». Дело в том
Посмотреть Оригинал
post-image
  • Награда
  • комментарий
  • Репост
  • Поделиться
Как строить публично?
Сегодня я заставил ИИ работать с раннего утра до позднего вечера: продвинул задачи, исследования, скрипты и очереди на несколько шагов вперёд, но в X всё равно почти нечего публиковать. Контент-система ведёт себя так, будто у неё вообще не было темы.
16-го я выпустил 8 публикаций, 17-го сделал больше реальной работы — и при этом подача явно снизилась.
Поэтому я сделал Work → Surface v1.
Он прошёл 19/19 тестов, а также прочитал и проверил 99 live task card. На данный момент есть только один зрелый reusable object, который автоматически порождает 2 preview-ready пак
Посмотреть Оригинал
post-image
  • Награда
  • комментарий
  • Репост
  • Поделиться
Я только что прогнал, собранный мной собственноручно read-only скрейпер, и полностью просканировал все 14 рынков MLB moneyline на Polymarket и Kalshi. 14/14 сделок совпали — даты, команды, конкретные матчи, всё можно однозначно сопоставить.
Промежуточные цены при сопоставлении результатов на двух платформах: абсолютное расхождение — от 0 до 2,0 процентных пункта. Если на обоих платформах покупать противоположные исходы, то минимальная суммарная стоимость с учётом комиссий перед вычетом прибыли — всего лишь ровно 1,00, то есть пока не выходит в плюс.
После того как я по опубликованным taker fee
KALSHI-8,88%
Посмотреть Оригинал
post-image
  • Награда
  • комментарий
  • Репост
  • Поделиться
一个人 + AI 到底能干多少活?
很多人以为关键是多开几个 agent,让它们并行跑。结果真正决定你每天能交出多少东西的,往往是几件更基础的事。
任务立卡
超过 10 分钟的活,我现在不会直接丢给 AI 就开工,而是先花几分钟写一张轻量卡,写清楚目标、边界、验收标准和最多试几次。AI 必须按卡上的标准做到位才算完成,不能自己觉得「差不多」就交。卡存成 JSON 文件,关掉聊天窗口、换模型、第二天回来,都能直接读着继续。
没有这张卡,活很容易做到一半就糊弄过去,或者永远停在「再改改」。
多模型按活分工
我不会让同一个模型从头包到尾。Claude 主要负责判断和总控方向,Codex 用来做交叉验证和技术审,Cursor 接 spec 已经说清楚的工程实现,Grok 专注写公开内容的正文。切换是按阶段,而不是每轮都重新挑。不是谁便宜就用谁,而是看这个阶段哪个模型的水平能把质量打到该有的样子。
用错模型,后面返工的时间比省下的还多。
状态全部写进文件
任务进度、决策理由、交接要点,我几乎不留在聊天记录里。全部写到仓库的 Markdown 和 JSON 文件里,作为唯一事实来源。新开一个会话,或者直接换一个模型,先读这些文件就知道现在到哪一步了。聊天窗口随时能关,系统状态不会丢。
靠聊天窗口记东西,迟早会因为窗口重置或者模型换了而断掉。
质量门 + 数据回收环
内容发之前要先过质量门。只有
  • Награда
  • комментарий
  • Репост
  • Поделиться
Вы это выдержите?! Cursor, Codex и Claude один за другим увеличивают потребление моделей вдвое, либо же сбрасывают лимиты.
Конкуренция между вендорами — пользователям выгода 😁
Посмотреть Оригинал
  • Награда
  • комментарий
  • Репост
  • Поделиться
После того как на Robinhood Chain завершился первый раунд массового роста meme-коинов, начался первый по-настоящему серьёзный стресс-тест.
Я участвовал в этом несколько дней назад и всё это время наблюдал за этой группой монет. Когда я пишу эту заметку, $CASHCAT уже откатился с пиков примерно при $200 млн до около $120 млн: за 24 часа падение около 31%. $VEX снизился примерно на 21% и $4 663 упали примерно на 83%. Но это не означает, что все монеты рухнули одновременно: $MARIAN за последние 24 часа всё ещё растёт, просто в последние полчаса—час тоже началась резкая просадка.
Это показывает,
MEME0,01%
Посмотреть Оригинал
post-image
  • Награда
  • комментарий
  • Репост
  • Поделиться
Когда я использую ИИ, чтобы помочь с текстом, исследовать вопрос или принять решение, я сейчас обычно задаю его сразу нескольким моделям.
Но дело не в том, чтобы просто несколько раз спросить и не в том, чтобы смотреть, какой ответ звучит так, будто его поддерживает больше людей.
Реальная ценность в том, чтобы заставить разные модели принять решение независимо, вытащить их расхождения — а затем вернуться к исходным доказательствам и проверить.
Недавно я снова прошёл через этот процесс и только тогда понял, что раньше почти пропустил самый ключевой шаг. Я думал, что в нём участвовали три модели
Посмотреть Оригинал
post-image
  • Награда
  • комментарий
  • Репост
  • Поделиться
Кто-нибудь сталкивался с тем, что модель вдруг начинает отвечать на вопрос, который вы вообще не задавали? Я даже подумал, что Claude Ultra снова “уплыл”.
Оказалось, при разборе выяснилось, что в моём собственном harness спрятан второй “невидимый” пользователь.
Тот самый latest-intent hook, который предназначался для защиты от дрейфа, напрямую распознал уведомления о задачах Subagent как мои новые команды. Это уже подтверждённая в логах ошибка распознавания.
Хотя бы на этот раз я нашёл в своей системе на локальной машине вполне конкретный источник загрязнения. Обломки старых задач, динамическа
Посмотреть Оригинал
  • Награда
  • комментарий
  • Репост
  • Поделиться
Вы хотите, чтобы Codex Ultra меньше растрачивал лимиты, но при этом не пытались ради экономии токенов выстроить ещё одну сложную систему разделения ролей.
Я только что провёл минимальный эксперимент: основная модель всё ещё GPT-5.6 Sol Ultra — она отвечает только за сложные решения, разбиение задач и окончательную приёмку. Поиск материалов, сканирование кода и прочую «живую» работу отдаю более быстрой и более экономной Terra Medium — на протяжении всего процесса только чтение, без изменений; задачи с чёткими границами и понятным планом выполнения напрямую передаю Sol Medium; всё сложное, туман
Посмотреть Оригинал
post-image
  • Награда
  • комментарий
  • Репост
  • Поделиться
  • Закреплено