runesleo

vip
Idade 8.5Ano
Nível máximo 6
Ainda sem conteúdo
Agora toda a gente está a pedir ao AI para escrever código, mas hoje fiz uma coisa ainda mais emocionante — fiz com que ele escrevesse um trecho de código que vai gastar dinheiro automaticamente, com ordens totalmente feitas sem qualquer supervisão.
Primeiro escrevi bem a lógica de decisão, pensando cuidadosamente nos limites, nos piores cenários e nas condições de kill antes de avançar. A ideia era deixar o Codex montar os atuadores por si, mas o canal de distribuição esteve instável durante todo o dia; então mudei para eu próprio construir tudo, passo a passo, no meu thread principal.
Antes
Ver original
post-image
  • Recompensa
  • 1
  • Republicar
  • Partilhar
scarletxanin:
muito obrigado por isto
No X, aquelas capturas de ecrã e números que parecem mais exagerados são, na verdade, as coisas mais fáceis de verificar na era da IA.
Se deres o post original e as capturas de ecrã à IA para uma análise aprofundada, as divergências na métrica, as falhas de evidência e as inconsistências entre o antes e o depois vão aparecer rapidamente.
O que é fiável e o que não é fiável já não é tão difícil de confirmar como antes.
Ver original
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Recentemente, voltei a rever o roteamento entre modelos com múltiplas opções, incluindo recibos de degradação explícita e um gate de ações manuais. O objetivo é garantir que o sistema continue controlável quando um modelo falhar.
Na data em que a Hugging Face divulgou oficialmente registos de ataque com mais de 17,000 entradas em 2026-07-16, eu só então percebi se a rota de análise em self-hosted conseguia realmente funcionar no dia do incidente — e não tinha sido verificado de todo.
A equipa da Hugging Face primeiro processou esses registos com modelos de ponta da API comercial. Como resultad
Ver original
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Há cinco dias, bloqueei as quatro lanes do Claude, Codex, Cursor e Grok no modelo mais forte e com a configuração de máxima inferência. A ideia era: já que paguei, devo usar o melhor até ao limite.
Cinco dias depois, percebi que simplesmente não aguenta. O limite desce rápido demais. O modelo mais forte é usado para fazer verificações repetitivas e tarefas de formatação, o que é pura perda.
Agora mudei: divido com base na densidade de decisões. Para tarefas como revisão, validação cruzada e estratégias de fundos, em que errar custa dinheiro ou polui os dados, mantenho o lugar do modelo mais fo
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Muitas pessoas, ao verem que os acontecimentos do mundo real já terminaram, notam que os títulos do mercado estão escritos de forma bem clara e até que o preço mostrado se aproxima de 0 ou 1. Por isso, acham que o mercado da Polymarket já está definitivamente liquidado.
Na verdade, esses sinais, por si só, não provam que o mercado já tenha sido definitivamente decidido. O título apenas descreve o problema, e o preço apresentado apenas reflete um estado atual do mercado.
O meu critério é simples: só deixo passar estas seis perguntas. Se qualquer uma não estiver clara, salto esse mercado.
1. O q
Ver original
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Eu atribuí o mesmo requisito de UI ao mesmo modelo 9 vezes: 3 vezes sem Skill, 3 vezes com apple-design e 3 vezes com ui-ux-pro-max.
Os resultados levaram-me a mudar a forma de avaliar: a mesma combinação de Skill pode correr muito bem uma vez e falhar na outra.
Depois de anonimizar os 9 resultados e de os entregar a duas pessoas para pontuarem de forma independente, as médias por grupo foram:
apple-design 91.3
ui-ux-pro-max 89.0
sem Skill 85.8
No entanto, em nenhum dos três grupos foi possível obter 3/3 sem defeitos.
apple-design e sem Skill tiveram, cada um, uma vez em que o bo
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
O fracasso mais perigoso num workflow de IA não é um erro direto.
É o modelo principal que cai e o backup também não fica a funcionar,
mas o sistema continua a cuspir um trecho de resultados que parece completo, levando as pessoas a acreditar que ficou feito.
Já apanhei uma vez: no processamento diário de informação, o modelo principal parou ao fim de 60 segundos e foi interrompido, o backup também não teve sucesso, e no fim ainda assim recebi um texto de extração com bom aspeto. O problema não é “trocar de rota e tentar de novo”; é que, depois de trocar de rota, ninguém deixou isso claro.
Mai
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Como fazer build in public?
Hoje deixei o AI a trabalhar das 8 às 20, a avançar tarefas, pesquisa, scripts e filas, e no fim, no X, ainda não havia muito para publicar. O sistema de conteúdos pareceu não ter escolhido nenhum tema.
No dia 16, publiquei 8 conteúdos; no dia 17, fiz mais trabalho prático, mas a oferta caiu claramente.
Por isso, fiz o Work → Surface v1.
Passou nos testes 19/19, e também lê e valida 99 live task cards. Atualmente, só tenho um reusable object maduro, capaz de derivar automaticamente 2 packets prontos para preview.
O sistema não publica, não faz deploy nem cobra autom
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Acabei de varrer, com um agregador somente de leitura que construí eu próprio, todos os 14 mercados de moneyline de MLB no Polymarket e no Kalshi. Em 14/14 jogos, estava tudo certo; a data, as equipas e exatamente qual jogo era, tudo corresponde perfeitamente.
O preço médio intermédio que corresponde entre as duas plataformas tem uma diferença absoluta entre 0 e 2,0 pontos percentuais. Ao comprar resultados opostos em cada plataforma, o custo total antes de taxas é pelo menos 1,00, ainda sem lucro.
Depois de estimar, de forma realmente baseada na fee de taker pública, as taxas dos dois lados,
KALSHI-3,67%
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Uma pessoa + IA到底能 fazer quanto trabalho?
Muita gente acha que o关键 é abrir mais agentes e deixá-los a correr em paralelo. Só que o que realmente determina quantas coisas consegues entregar por dia são, muitas vezes, algumas tarefas mais básicas.
Cartão de tarefas
Para trabalhos com mais de 10 minutos, eu não entrego diretamente à IA e começo. Em vez disso, passo primeiro alguns minutos a escrever um cartão leve, deixando claros o objetivo, os limites, os critérios de aceitação e, no máximo, quantas tentativas. A IA só é considerada concluída se cumprir os critérios do cartão; não pode achar “m
Ver original
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Isto aguenta-se assim?!A Cursor, a Codex e a Claude têm estado a aumentar o consumo dos modelos diretamente em dobro, uma a seguir à outra, ou então a repor os limites.
Com a concorrência entre as empresas, os utilizadores têm sorte😁
Ver original
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
  • Fixado