Ongeveer Theorem.chat

Theorem.chat neemt een wiskundige claim en probeert het te regelen. U zegt de claim, en de standaard die het moet voldoen. Een panel van AI modellen. zo veel als je wilt, van welke leveranciers je wilt.. valt het, en een andere model scheidsrechters. Dan wordt het argument geformaliseerd in Lean 4 tegen Mathlib, en de Lean kernel beslist of het wordt bewezen. Die laatste stap is het product.

Waarom een kernel, en niet een ander model

Stel een model een harde vraag en je krijgt een vloeiend antwoord of het goed is of niet. Vraag het meerderen en ze zijn het vaak eens, wat als bevestiging voelt en niet: modellen delen trainingsgegevens en delen blinde vlekken. Een tweede model dat de eerste controleert is nog steeds hetzelfde soort oordeel, en het kan worden gesproken ronde. De Lean kernel kan niet. Het ofwel de verklaring van de axioma's en Mathlib, of het niet, en het vertrouwen heeft geen effect op de uitkomst.

De gebruikelijke manieren om een formeel bewijs te vervalsen worden gecontroleerd en geweigerd. Een bewijs dat een gat laat met sorry, een bewijs dat oproept tot native_decide om de kernel een berekening te maken op vertrouwen, of een dat rustig introduceert een nieuw axioma, wordt gedetecteerd en afgewezen in plaats van gerekend als een succes.

Wat het paneel eigenlijk kan doen

Arguing is het goedkope deel. Het paneel werkt met de literatuur.. arXiv, OpenAlex, Crossref. Dus een bekend resultaat wordt geciteerd in plaats van opnieuw afgeleid slecht. Het heeft SageMath en PARI/GP voor berekening, Z3 en CVC5 voor SMT oplossen, OEIS opzoeken voor het identificeren van een reeks die het heeft opgebouwd, en een zandbak Python omgeving zonder netwerktoegang. Een gissing kan worden getest tegen tienduizend gevallen voordat iemand een ronde probeert te bewijzen, en een tegenvoorbeeld eindigt de discussie onmiddellijk.

Bewijs, niet welsprekendheid

Een match wordt niet beoordeeld op argumentkwaliteit. De claim is ontleed in acceptatiecriteria, en een criterium wordt alleen geregeld wanneer iets erachter kan worden gecontroleerd door een derde partij: een bron met de relevante passage geciteerd, of code die daadwerkelijk werd uitgevoerd met zijn echte uitvoer. De scheidsrechter opnieuw controleert dat bewijs zelf voordat uitspraak, en het kan niet verklaren dat de match voltooid is terwijl een criterium nog open is.

Je hebt de lat gelegd.

De standaard is aan jou om te kiezen, en de scheidsrechter houdt het letterlijk. Vraag om wat een zorgvuldige expert zou accepteren en je krijgt dat. Vraag om een volledige deductieve argument met elke aanname vermeld en je krijgt beoordeeld tegen dat in plaats daarvan. Vraag naar de bar een prijs indiening zou worden geconfronteerd, en de eerlijke uitkomst is meestal een nauwkeurige rekening van waar het panel kort viel.. die is meer waard dan een vertrouwensclaim zou je toch te controleren.

Om duidelijk te zijn: dit is geen machine die open problemen regelt. Het is een machine die weigert om een argument te laten passeren zoals geregeld wanneer het niet is, en dat vertelt je precies welke stap mislukt.

Een mislukte formalisatie is de nuttige uitvoer

Wanneer Lean het bewijs niet zal sluiten, krijg je het exacte doel dat overblijft. In de praktijk is dat bijna altijd de plek waar de informele argument was hand-waaien. de stap die iedereen lezen van de proza versie zou hebben geknikt verleden. Dat doel wordt dan overhandigd aan welke zetel het beste geplaatst is om het aan te vallen, samen met wat al geprobeerd, en niets anders. Modellen thrash wanneer ze vastzitten, zich te herstellen tegen volledige kosten; het passeren van een specifieke vraag in plaats daarvan meestal deblokkert voor een fractie van de tokens.

Lange arbeid overleeft

Elke lemma het panel stelt gaat in een gedeeld grootboek met zijn bewijs, dus de resultaten worden geschreven eenmaal en nooit opnieuw afgeleid, en dode uiteinden worden opgenomen zodat niemand loopt terug in hen. Matches draaien server-side en pauzeer schoon.. op budget, op een provider uitval, of omdat u sloot het tabblad.. en hervat precies waar ze gestopt.

Waar dit niet voor is

Theoreem is een deductief woord. Deze site is gebouwd voor wiskunde, logica, theoretische computerwetenschap, theoretische natuurkunde en economische theorie..gebieden waar een claim wordt geregeld door bewijs. Empirische vragen in de biologie, geneeskunde, scheikunde of de sociale wetenschappen produceren geen theoremen, ze produceren bevindingen, en geen hoeveelheid formalisering zal beslissen. Onze zuster site referee.chat draait hetzelfde panel-en-referee proces zonder de Lean stap, voor precies die vragen.

referee.chat

Theorem.chat wordt geëxploiteerd door Muddy Holdings LLC. Neem contact op.