About Theorem.chat

Theorem.chat takes a mathematical claim and tries to settle it. You state the claim, and the standard it has to meet. A panel of AI models — as many as you want, from whichever vendors you want — attacks it, and one more model referees. Then the argument is formalised in Lean 4 against Mathlib, and the Lean kernel decides whether it is proved. That last step is the product.

Mengapa kernel, dan bukan model lain

Ask a model a hard question and you get a fluent answer whether or not it is right. Ask several and they often agree, which feels like corroboration and is not: models share training data and share blind spots. A second model checking the first is still the same kind of judgement, and it can be talked round. The Lean kernel cannot. It either derives the statement from the axioms and Mathlib, or it does not, and confidence has no effect on the outcome.

The usual ways to fake a formal proof are checked for and refused. A proof that leaves a hole with sorry, one that appeals to native_decide to make the kernel take a computation on trust, or one that quietly introduces a new axiom, is detected and rejected rather than counted as a success.

Apa panel benar-benar dapat melakukan

Arguing is the cheap part. The panel works with the literature — arXiv, OpenAlex, Crossref — so a known result is cited rather than re-derived badly. It has SageMath and PARI/GP for computation, Z3 and CVC5 for SMT solving, OEIS lookup for identifying a sequence it has constructed, and a sandboxed Python environment with no network access. A conjecture can be tested against ten thousand cases before anyone spends a round trying to prove it, and a counterexample ends the discussion immediately.

Bukti, bukan kefasihan

Sebuah kecocokan tidak akan dinilai pada kualitas argumen. Klaim didegradasi menjadi kriteria penerimaan, dan kriteria hanya diselesaikan ketika sesuatu di belakang dapat diperiksa ulang oleh pihak ketiga: sebuah sumber dengan bagian yang terkait dikutip, atau kode yang sebenarnya dijalankan dengan keluaran sebenarnya. Wasit memeriksa ulang bukti yang ada sebelum putusan, dan tidak dapat mendeklarasikan kecocokan yang selesai sementara sebuah kritik masih terbuka.

Anda mengatur bar

Standarnya adalah pilihan anda, dan wasit memegang itu secara harfiah. tanyakan apa yang akan diterima oleh seorang ahli yang hati-hati dan anda dapatkan. minta argumen deduktif lengkap dengan setiap asumsi yang dinyatakan dan anda akan diadili sebaliknya. tanyakan pada bar mengenai penyerahan hadiah akan dihadapi, dan hasil jujur biasanya adalah akun yang tepat dimana panel jatuh pendek ▪ yang lebih berharga daripada klaim yang meyakinkan anda harus tetap memeriksa diri anda.

Untuk menjadi jelas tentang hal itu: ini bukan mesin yang menyelesaikan masalah terbuka. ini adalah mesin yang menolak untuk membiarkan argumen lulus sebagai diselesaikan ketika tidak, dan yang memberitahu Anda persis mana langkah gagal.

Formaksimalisasi yang gagal adalah keluaran yang berguna

Ketika Lean tidak akan menutup bukti, Anda mendapatkan tujuan yang tepat yang tersisa. Dalam praktek yang hampir selalu tempat argumen informal adalah tangan-mengarung å langkah semua orang membaca versi prosa akan mengangguk masa lalu. Tujuan itu kemudian diserahkan ke kursi mana pun yang terbaik ditempatkan untuk menyerang itu, bersama dengan apa yang sudah dicoba, dan tidak ada lagi. Model pukulan ketika mereka terjebak, beristirahat pada biaya penuh; melewati satu pertanyaan khusus sebaliknya biasanya unblocks untuk fraksi token.

Kerja panjang bertahan

Setiap peta panel yang didirikan akan masuk ke dalam buku besar bersama dengan buktinya, sehingga hasil ditulis sekali dan tidak pernah kembali berdefif, dan ujung-ujung mati direkam sehingga tidak ada yang berjalan kembali ke mereka. Matches menjalankan server-side dan berhenti bersih pada anggaran, pada outage penyedia, atau karena Anda menutup tab Á dan melanjutkan persis di mana mereka berhenti.

Apa ini bukan untuk

Theorem is a deductive word. This site is built for mathematics, logic, theoretical computer science, theoretical physics and economic theory — fields where a claim is settled by proof. Empirical questions in biology, medicine, chemistry or the social sciences do not produce theorems, they produce findings, and no amount of formalisation will decide them. Our sister site referee.chat runs the same panel-and-referee process without the Lean step, for exactly those questions.

referee.chat — the same idea, for empirical claims

Theorem.chat is operated by Muddy Holdings LLC. Hubungi aku.