Circa Theorem.chat
Theorem.chat prende un reclamo matematico e cerca di risolverlo. Dichiarate il reclamo, e lo standard che deve soddisfare. Un pannello di modelli AI ® quanti quanti volete, da qualsiasi fornitore si desidera ® attacca, e un altro modello arbitri. Poi l'argomento è formalizzato in Lean 4 contro Mathlib, e il kernel Lean decide se è dimostrato. Quell'ultimo passo è il prodotto.
Perché un kernel, e non un altro modello
Fai una domanda difficile a un modello e ottieni una risposta fluente se è giusto o no. Chiedi parecchie volte e sono d'accordo, che sembra una conferma e non lo è: i modelli condividono i dati di allenamento e condividono punti ciechi. Un secondo modello che controlla il primo è ancora lo stesso tipo di giudizio, e può essere parlato intorno. Il kernel Lean non può. O deriva la dichiarazione dagli assiomi e Mathlib, o non lo fa, e la fiducia non ha effetto sul risultato.
I soliti modi di falsificare una prova formale vengono controllati e rifiutati. Una prova che lascia un buco con sorry, che fa appello a native_decide per fare un calcolo sulla fiducia, o che introduce tranquillamente un nuovo assioma, viene rilevata e respinta piuttosto che considerata un successo.
Cosa può fare il pannello
Il pannello lavora con la letteratura... arXiv, OpenAlex, Crossref.., quindi un risultato noto è citato piuttosto che re-derivato male. Ha SageMath e PARI/GP per il calcolo, Z3 e CVC5 per la soluzione SMT, OEIS ricerca per identificare una sequenza che ha costruito, e un ambiente sandboxed Python senza accesso alla rete. Una congettura può essere testato contro diecimila casi prima che qualcuno spende un giro cercando di provarlo, e un controesempio termina la discussione immediatamente.
Prove, non eloquenza
Una corrispondenza non è segnata sulla qualità degli argomenti. La richiesta è decomposta in criteri di accettazione, e un criterio è risolto solo quando qualcosa dietro di esso può essere ricontrollato da una terza parte: una fonte con il passaggio pertinente citato, o codice che è stato effettivamente eseguito con il suo output reale. L'arbitro ricontrolla che si evidenzia prima di decidere, e non può dichiarare la partita terminata mentre un criterio è ancora aperto.
Hai impostato il bar
Lo standard è tuo da scegliere, e l'arbitro lo tiene letteralmente. Chiedi quello che un esperto attento accetterebbe e lo ottieni. Chiedi un argomento deduttivo completo con ogni ipotesi dichiarata e ottieni invece giudicato contro quello. Chiedi la barra che una presentazione di premio dovrebbe affrontare, e l'esito onesto è di solito un preciso conto di dove il pannello è caduto corto... che vale più di una richiesta fiduciosa che dovresti controllare te stesso comunque.
Per essere chiari: questa non è una macchina che risolve i problemi aperti. È una macchina che rifiuta di lasciare passare un argomento come stabilito quando non lo è, e che ti dice esattamente quale passo è fallito.
Una formalizzazione fallita è l'utile risultato
Quando Lean non chiuderà la prova, si ottiene l'obiettivo esatto che rimane. In pratica che è quasi sempre il punto in cui l'argomento informale era sventolando a mano • il passo che tutti leggevano la versione prosa avrebbe annuito passato. Tale obiettivo viene poi consegnato a qualsiasi posto è meglio posizionato per attaccarlo, insieme a ciò che è già stato provato, e nient'altro. Modelli thrash quando sono bloccati, rimontando a costo pieno; passando una domanda specifica invece di solito sblocca per una frazione dei gettoni.
Il lavoro lungo sopravvive
Ogni lemma che il pannello stabilisce va in un registro condiviso con la sua prova, in modo che i risultati sono scritti una volta e mai re-derivati, e vicoli morti sono registrati in modo che nessuno rientra in loro. Corrisponde eseguire server-side e fermare cleanly Hoppenstedt sul budget, su un fornitore di interruzione, o perché hai chiuso la scheda Hoppenstedt e riprendere esattamente dove si sono fermati.
A cosa non serve?
Theorem is a deductive word. This site is built for mathematics, logic, theoretical computer science, theoretical physics and economic theory — fields where a claim is settled by proof. Empirical questions in biology, medicine, chemistry or the social sciences do not produce theorems, they produce findings, and no amount of formalisation will decide them. Our sister site referee.chat runs the same panel-and-referee process without the Lean step, for exactly those questions.
referee.chat και la stessa idea, per le rivendicazioni empiriche