Satu pola, banyak pengetahuan

Paris, Beijing, Oslo, dan Tokyo muncul ketika TOBA ditanya tentang ibu kota empat negara yang berbeda. Bentuk pertanyaannya tetap; pengetahuan yang dipanggil berubah mengikuti negara.

Di sisi lain, Kanada, Australia, dan Papua Nugini memunculkan kota yang keliru. Thailand memuat Bangkok—kota yang tepat—di tengah respons yang rusak. Pola yang benar belum menjamin fakta yang mengisinya juga benar.

Dalam artikel ini, recall — pemanggilan kembali fakta—berarti upaya model memanggil relasi negara–ibu kota dari pengetahuan yang telah dipelajari.

Observasi eksplorasi one-shot — satu kali pengujian per negara. Catatan ini menunjukkan perilaku yang menarik untuk diperiksa, bukan pengukuran konsistensi lintas negara.

Observasi eksplorasi one-shot
Gambar 1. Label benar atau salah pada visual hanya menilai kota utama yang disebut. Respons Norwegia, Jepang, dan Thailand memuat teks sekitar yang rusak; empat kota utama yang benar tidak berarti empat respons sepenuhnya bersih.
Pertanyaan inti

Bagaimana satu pola pertanyaan dapat digunakan untuk memanggil pengetahuan tentang banyak negara yang berbeda?

Jejak pola di dalam data

Sebelum mengukur efisiensi, dua jenis paparan perlu dipisahkan. Pasangan pertanyaan–jawaban (QA) langsung mengajarkan bentuk pertanyaan sekaligus bentuk jawaban. Kalimat deklaratif seperti “ibu kota X adalah Y” memperkuat relasi faktual tanpa menjadi pasangan masukan–respons.

Dalam snapshot SFT yang diaudit—salinan data pada satu waktu—terdapat 76 kandidat pertanyaan ibu-kota eksplisit; 60 di antaranya memiliki jawaban selain Jawaban tidak tersedia dalam konteks. Setelah inspeksi, jumlah contoh pola yang efektif diperkirakan sekitar 45–55 bila wilayah dan kasus historis ikut dihitung, atau sekitar 15–25 bila hanya negara modern. Di luar pasangan itu, ada 560 baris SFT deklaratif yang turut memperkuat relasi.

Pemindaian dataset
Gambar 2. Bukti pemindaian dataset membedakan contoh yang mengajarkan format tugas dari kalimat yang memperkuat relasi faktual.
Pola yang dapat digunakan kembali

Kerangka tetap, bagian faktual berganti

apa ibu kota [negara]?ibu kota [negara] adalah [kota]

  1. Bentuk tugasPretraining dan SFT membantu model mengenali pertanyaan serta kerangka respons.
  2. Negara dari pertanyaanNama negara dipertahankan agar jawaban tetap terikat pada entitas yang ditanyakan.
  3. Kota dari pengetahuanKota yang diisikan bergantung pada pengikatan negara dan kota yang berhasil dipanggil.

Norwegia–Oslo tidak ditemukan sebagai pasangan SFT langsung dalam snapshot SFT yang diaudit, tetapi TOBA menyebut Oslo. Pemeriksaan snapshot ini tidak membuktikan bahwa pasangan identik tersebut absen dari seluruh data pelatihan. Generalisasi lintas negara juga tidak membuktikan satu pasangan pertanyaan–jawaban identik tersedia untuk setiap negara.

Untuk membaca audit berikutnya: co-occurrence — kemunculan bersama dua nama dalam satu unit data; capital-near — konteks dekat yang juga memuat penanda ibu kota. Keduanya mengukur jejak teks, bukan sebab perilaku model.

Belasan contoh mungkin sudah cukup

Indeks Efisiensi Transfer pola ibu-kota, atau IET-capital, menaksir berapa banyak contoh SFT yang dibutuhkan sebelum format pertanyaan tampak dapat digunakan pada negara lain.

Estimasi heuristik
Gambar 3. Rentang 8–16 menjadi pembacaan utama; 16–32 adalah rentang konservatif dan 45–55 adalah batas atas observasional dari snapshot saat ini.
Batas pembacaan

Angka 8–16 merupakan estimasi kerja dengan tingkat keyakinan rendah–menengah. Karena model tidak dilatih ulang menggunakan jumlah contoh yang berbeda, angka ini belum dapat dianggap sebagai ambang kausal atau indeks ilmiah baku.

Norwegia–Oslo menjadi jangkar interpretasinya: pasangan SFT langsung itu tidak ditemukan dalam snapshot yang diaudit, sedangkan keluaran inferensi menyebut Oslo. Observasi ini konsisten dengan transfer format yang membantu mengaktifkan pengetahuan dari pretraining, tetapi bukan bukti tentang mekanisme internal model.

IET mengukur perkiraan aktivasi format, bukan reliabilitas fakta. Dengan kata lain, pola dapat aktif lebih dahulu daripada kemampuan memilih kota yang benar.

Kanada sebagai stress test

Kasus Kanada bukan bantahan terhadap transfer pola. Karena bentuk jawabannya sudah terbentuk dengan baik, kasus ini justru memperlihatkan bahwa pengenalan pola dan pemanggilan fakta adalah dua kemampuan yang berbeda.

Prompt (masukan pertanyaan kepada model) apa ibu kota kanada? dijalankan 30 kali dalam mode Balanced. Memori dinonaktifkan dan percakapan dibersihkan sebelum setiap percobaan (trial). Model terus membentuk kalimat yang sesuai pola, tetapi mengisinya dengan Toronto, bukan Ottawa yang ditetapkan sebagai ibu kota oleh Pemerintah Kanada. Dalam kondisi few-shot — beberapa contoh di dalam prompt, contoh Prancis disediakan sebelum pertanyaan Kanada.

Eksperimen terkontrol · 150 keluaran
Gambar 4. Empat kondisi utama menghasilkan 120 trial utama; koreksi menambah 30 follow-up koreksi. Masing-masing kondisi menyelesaikan 30 trial.

Balanced, tanpa petunjuk: 0/30 benar; 30/30 Toronto — satu respons unik.

Precise: 0/30 benar; 30/30 Toronto — satu respons unik.

Few-shot dengan contoh tetap: 0/30 benar — satu respons unik yang mengulang pertanyaan Prancis, bukan menerapkan polanya pada Kanada.

Pilihan ganda: 0/30 benar — satu respons unik yang menyalin semua opsi tanpa memilih. Sekadar menyalin opsi yang memuat Ottawa tidak dihitung sebagai jawaban benar.

Koreksi: 0/30 berubah ke Ottawa — satu respons unik yang mengonfirmasi jawaban sebelumnya tanpa kota final.

Respons mentah, anotasi semantik, sidik hash, parameter, dan bukti pemindaian tersimpan dalam paket bukti penelitian (evidence bundle).

Konteks data memperjelas diagnosis

Pemindaian hanya-baca (read-only) mencakup 3.237.571 baris SFT dan 2.003.181 dokumen pretraining. Pada co-occurrence umum, Kanada lebih sering muncul bersama Toronto: 301 baris versus 144 baris di SFT, serta 3.886 dokumen versus 1.553 dokumen di pretraining.

Ketika konteks dipersempit menjadi capital-near—negara dan kota berada dalam rentang teks gabungan maksimal 320 karakter, dengan penanda ibu kota, ibukota, atau capital di antaranya—Ottawa justru unggul: 21 versus 10 di SFT dan 53 versus 26 di pretraining.

Pemindaian dataset
Gambar 5. Asosiasi umum condong ke Toronto, sedangkan konteks yang lebih dekat dengan relasi ibu kota condong ke Ottawa.
Satu baris, dua hitungan

Baris SFT 2663325 menyatakan Toronto sebagai ibu kota Ontario dan Ottawa sebagai ibu kota negara Kanada. Baris benar ini masuk dalam hitungan Kanada–Toronto sekaligus Kanada–Ottawa.

Batas metode

Hitungan ini berbasis pencarian teks; kemunculan potongan teks (substring) tidak membuktikan penyebab keluaran Toronto. Ia juga tidak berarti dataset menyatakan fakta yang salah.

Bukti terkontrol pada Kanada memang lebih kuat daripada observasi keberhasilan lintas negara. Nilainya bukan sebagai vonis, melainkan sebagai diagnosis: format jawaban dapat stabil ketika recall faktualnya belum stabil.

Bagaimana kemampuan ini bekerja

Recall mengangkat kandidat kota setelah prompt menunjukkan relasi dan negara yang dicari. Setelah itu, decoding — tahap pemilihan token akhir—menentukan kandidat mana yang benar-benar masuk ke respons.

Lima tahap di bawah adalah cara membaca bukti secara konseptual. Diagram tidak berasal dari pengukuran aktivasi internal.

Interpretasi konseptual
Gambar 6. Kedua lintasan memakai tahap yang sama. Ini interpretasi konseptual, bukan pengukuran kausal atau probing aktivasi internal.

Pada jalur Norwegia, pola pertanyaan tampak mengaktifkan relasi yang mengarah ke Oslo. Pada jalur Kanada, bentuk respons tetap bekerja, tetapi Toronto bertahan sebagai kandidat. Perbandingan ini memisahkan transfer cara menjawab dari ketepatan pengetahuan yang dipanggil.

Kemampuan yang mulai terlihat

Kesimpulan yang didukung bukti

Temuan paling menarik bukan bahwa TOBA kadang salah menjawab ibu kota. Temuannya adalah bahwa model tampaknya telah mempelajari pola yang dapat digunakan kembali untuk memanggil pengetahuan tentang negara yang berbeda.

Jawaban dapat tepat ketika paparan pretraining menyediakan asosiasi faktual yang relevan, pembelajaran relasi membedakan negara dan kota, SFT membentuk cara menjawab, prompt mengaktifkan kandidat yang sesuai, dan decoding mempertahankannya. Paris, Beijing, Oslo, dan Tokyo memberi ilustrasi eksplorasi untuk jalur ini tanpa mengukur konsistensinya.

Kanada menunjukkan bahwa transfer pola dapat muncul lebih dahulu daripada recall faktual yang stabil. Kerangka bahasa dapat terbentuk sementara kandidat kota masih dibelokkan oleh asosiasi pesaing atau gagal dipilih dengan tepat.

Pertanyaan riset yang terbuka bukan lagi sekadar apakah model tahu sebuah kota, melainkan kapan pola yang dapat digunakan ulang berhasil mengikat negara pada fakta yang tepat.

Sumber dan asal bukti (provenance)

  1. Fakta rujukan: Pemerintah Kanada menyatakan Ottawa sebagai ibu kota Kanada.
  2. Eksperimen: 120 trial utama dan 30 follow-up koreksi; respons mentah, anotasi semantik, sidik hash, parameter, serta bukti dataset disimpan dalam paket bukti penelitian.
  3. Estimasi IET-capital berasal dari audit hanya-baca snapshot SFT saat ini; rentangnya heuristik dan tidak menggantikan uji ablasi (ablation).
  4. Contoh lintas negara merupakan observasi eksplorasi, bukan estimasi akurasi atau konsistensi.