Ligikaudu Theorem.chat
Theorem.chat võtab matemaatilise väite ja püüab seda lahendada. Sa märkida nõue, ja standard see peab vastama. Paneel AI mudelid ~ nii palju kui soovite, ükskõik, millise müüjad soovite ~ ründab seda, ja veel üks mudel kohtunikke. Siis argument on vormistatud Lean 4 vastu Mathlib, ja Lean kernel otsustab, kas see on tõestatud. See viimane samm on toode.
Miks kernel, mitte teine mudel
Küsi mudelilt raske küsimus ja saad avameelselt vastuse, kas see on õige või mitte. Küsi mitmelt ja nad on sageli ühel meelel, mis tundub kinnitusena ja ei ole: mudelid jagavad treeningandmeid ja jagavad pimekohti. Teine mudel kontrollib esimest on ikka sama tüüpi kohtuotsus ja seda saab rääkida ringis. Lean kernel ei saa. See kas saab avalduse aksioomanitest ja Mathlib või see ei ole, ja usaldus ei mõjuta tulemust.
Tavapärased viisid võltsida ametlik tõend on kontrollitud ja tagasi lükatud. Tõend, mis jätab augu sorry, üks, mis pöördub native_decide teha tuuma võtta arvutus usalduse, või üks, mis vaikselt tutvustab uus aksioom, avastatakse ja tagasi lükata, mitte lugeda edu.
Mida paneel tegelikult teha saab
Aruandmine on odav osa. Paneel töötab kirjandusega ~ arXiv, OpenAlex, Crossref ~ nii tuntud tulemus on viidatud, mitte uuesti tuletatud halvasti. See on SageMath ja PARI/GP arvutus, Z3 ja CVC5 SMT lahendamine, OEIS otsida kindlaks jada ta on ehitatud, ja liivakasti Python keskkond ilma võrgu juurdepääsu. Oletusi saab katsetada kümne tuhande juhul, enne kui keegi kulutab vooru üritab seda tõestada, ja counterexample lõpetab arutelu kohe.
Tõendid, mitte kõneosavus
Matð ei ole saadud argumenti kvaliteedi põhjal. Nõue on lagunenud aktsepteerimiskriteeriumideks ja kriteerium on lahendatud ainult siis, kui kolmas isik saab midagi selle taga kontrollida: allikas, millel on vastav lõik või kood, mis tegelikult täideti tegeliku väljundiga. Kohtunik kontrollib enne otsustamist uuesti, et tõendid ise oleksid täidetud, ning see ei saa tunnistada mängu lõpetatuks, kui kriteerium on veel avatud.
Sina seadsid lati
Standard on sinu valida ja kohtunik hoiab seda sõna otseses mõttes. Küsi, mida hoolikas ekspert aktsepteeriks ja sa saad seda. Küsi täielik deduktiivne argument iga esitatud eelduse ja saad selle asemel hinnata. Küsi baari auhinna esitamine oleks silmitsi, ja aus tulemus on tavaliselt täpne konto, kus paneel langes lühike ~ mis on väärt rohkem kui kindel väide, et sa peaksid kontrollima ennast niikuinii.
Et olla selge: see ei ole masin, mis lahendab avatud probleeme. See on masin, mis keeldub laskmast argumenti läbi nagu see ei ole, ja mis ütleb teile täpselt, milline samm ebaõnnestus.
Ebaõnnestunud formaliseerimine on kasulik väljund
Kui Lean ei sulge tõendeid, saad täpselt eesmärgi, mis jääb. Praktikas on see peaaegu alati koht, kus mitteametlik argument oli käsitsi vehkimine ~ samm, mida igaüks lugedes prose versioon oleks noogutanud minevikku. See eesmärk antakse siis, milline koht on kõige sobivam rünnata, koos sellega, mida on juba proovitud, ja midagi muud. Mudelid thrash, kui nad on kinni, ümber ennast täishinnaga; kulgeb üks konkreetne küsimus asemel tavaliselt blokeerib murdosa märgid.
Pikk töö on elus
Iga lemma paneel kehtestab läheb jagatud pearaamatu koos oma tõendeid, nii et tulemused on kirjutatud üks kord ja kunagi uuesti tuletatud, ja surnud otsad on salvestatud nii, et keegi kõnnib tagasi neid. Sobib käivitada serveri-küljel ja paus puhtalt ~ eelarve, pakkuja seisaku, või sest sa sulgesid tab ~ ja jätkata täpselt, kus nad peatusid.
Milleks see pole?
Teoreem on deduktiivne sõna. See sait on ehitatud matemaatika, loogika, teoreetiline infotehnoloogia, teoreetiline füüsika ja majandusteooria ~ valdkondades, kus nõue on lahendatud tõend. Empiirilised küsimused bioloogia, meditsiini, keemia või sotsiaalteadused ei tooda teoreemid, nad toodavad tulemusi, ja ükski formaliseerimine otsustab neid. Meie õde sait referee.chat töötab sama paneel-ja referee protsessi ilma Lean samm, täpselt need küsimused.