- Mulai
- 12 Sep 2024KEYAKINAN 95%dari help.openai.com
OpenAI o1-preview dan o1-mini rilis
Diterjemahkan otomatis dari aslinya
Judul asli: OpenAI o1-preview and o1-mini Released
- OpenAI merilis o1-preview dan o1-mini pada 12 September 2024, dengan batas pesan mingguan ChatGPT masing-masing 30 dan 50[1]
- OpenAI menerbitkan system card pada 12 September untuk model-model ini[2]
- Sebuah podcast Oktober 2024 menjelaskan penalaran chain-of-thought milik o1, kekuatannya pada coding kompleks, uji keamanan head-to-head terhadap GPT-4o, serta evaluasi jailbreak, halusinasi, deception dan persuasi; podcast ini hanya menggunakan deskripsi episode, bukan transkrip[2]
- OpenAI menggunakan GPT-4o untuk memantau perilaku o1, dan menjalankan uji otonomi dan red-team pada keamanan siber dan disinformasi, menurut deskripsi podcast tersebut[2]
Notable features
- Yang pertama dari serial model penalaran baru yang dilatih untuk menghabiskan lebih banyak waktu berpikir melalui masalah sebelum merespons, belajar menyempurnakan pemikirannya, mencoba strategi berbeda dan mengenali kesalahan; OpenAI mengatur ulang penomoran ke 1 dan menamai serial ini OpenAI o1[3]
- Dalam pengujian OpenAI, model update selanjutnya, yang saat itu masih dikembangkan, memperoleh skor 83% pada ujian kualifikasi International Mathematics Olympiad berbanding 13% untuk GPT-4o, dan mencapai persentil ke-89 pada kontes Codeforces[3]
- Pendekatan pelatihan keamanan baru membuat model bernalar tentang aturan keamanan dalam konteks; pada salah satu uji jailbreaking tersulit OpenAI, o1-preview memperoleh skor 84 dari 100, berbanding 22 untuk GPT-4o[3]
- o1-mini adalah model penalaran yang lebih cepat dan murah yang sangat efektif untuk coding, 80% lebih murah dari o1-preview[3]
- Saat peluncuran, model-model ini belum memiliki penjelajahan web serta unggah file dan gambar di ChatGPT, dan API belum memiliki function calling, streaming dan system messages, dengan akses API untuk pengembang usage tier 5 pada 20 permintaan per menit[3]
Referensi 3KEYAKINAN 93%Keyakinan keseluruhan: 93%Seberapa baik sumber dan referensi pin mendukung tanggalnya.Rata-rata tertimbang dari seberapa kuat 3 referensi, termasuk sumber, mendukung waktu mulai dan berakhir pin; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaruTampilkan semua pin dengan keyakinan 75% atau lebih tinggi
Entri pertama selalu merupakan sumber pin. Keyakinan keseluruhan adalah rata-rata tertimbang dari seberapa kuat setiap referensi mendukung waktu mulai dan berakhir yang digunakan di atas; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaru.
- [1]95%OpenAI Model Release Notes: Introducing OpenAI o1-preview and o1-mini (September 12, 2024)help.openai.com· Diposting 19 Sep 2026· Mulai 12 Sep 2024· 89% dari skor
Catatan rilis model OpenAI sendiri menanggali entri ini 12 September 2024
- [2]70%AIandBlockchain: AI's Quantum Leap Unpacking OpenAI's O1 Modelspodcasts.apple.com· Diterbitkan 7 Okt 2024· 6% dari skor
AIandBlockchain's episode "AI's Quantum Leap Unpacking OpenAI's[1] O1 Models" (2024-10-07) says: "a bit unsettling. Join us as we break down the key elements of OpenAI's O1 models, using excerpts from their recently released system card ( September 12th ). We’ll discuss the unique strengths of the O1 Preview and O1 Mini models, highlighting their enhanced ability to handle complex coding tasks, while also"
- [3]88%Introducing OpenAI o1-preview | OpenAI (Wayback Machine copy)web.archive.org· Diterbitkan 12 Sep 2024· 5% dari skor
Archived copy of OpenAI's[1] o1-preview announcement, which says "GPT-4o correctly solved only 13% of problems, while the reasoning model scored 83%", o1-preview scored 84 on a jailbreaking test, and o1-mini "is 80% cheaper than o1-preview".
Sarankan koreksi
Ada yang kurang atau salah? Sampaikan dengan kata-kata Anda sendiri: tautan yang mendukung pin ini, tanggal mulai atau berakhir yang berbeda beserta alasannya, atau fakta yang kurang atau keliru. AI memeriksanya terhadap sumber pin ini, mencari sumber yang lebih baik, dan menambahkan halaman mana pun yang mendukung Anda. Sumber pin itu sendiri tetap paling diperhitungkan. Gambar yang menampilkan hal lain, atau menampilkannya dengan buruk, juga diperiksa, lalu diturunkan atau diganti.