- Mula
- 12 Sep 202495% KEYAKINANdaripada help.openai.com
OpenAI o1-preview dan o1-mini Dikeluarkan
Diterjemah secara automatik daripada asal
Tajuk asal: OpenAI o1-preview and o1-mini Released
- OpenAI mengeluarkan o1-preview dan o1-mini pada 12 September 2024, dengan had mesej ChatGPT mingguan masing-masing 30 dan 50[1]
- OpenAI menerbitkan kad sistem pada 12 September untuk model-model itu[2]
- Podcast Oktober 2024 menerangkan penaakulan rantaian pemikiran o1, kekuatannya pada pengekodan kompleks, ujian keselamatan berhadap-hadapan dengan GPT-4o, dan penilaian jailbreak, halusinasi, penipuan dan pemujukan; ia hanya menggunakan huraian episod, bukan transkrip[2]
- OpenAI menggunakan GPT-4o untuk memantau tingkah laku o1, dan menjalankan ujian autonomi dan red-team terhadap keselamatan siber dan maklumat salah, menurut huraian podcast[2]
Ciri utama
- Yang pertama daripada siri model penaakulan baharu yang dilatih untuk meluangkan lebih banyak masa memikirkan masalah sebelum memberi respons, belajar memperhalusi pemikiran mereka, mencuba strategi berbeza dan mengenali kesilapan; OpenAI menetapkan semula kaunter kepada 1 dan menamakan siri itu OpenAI o1[3]
- Dalam ujian OpenAI kemas kini model seterusnya, yang ketika itu dalam pembangunan, mendapat 83% pada peperiksaan kelayakan International Mathematics Olympiad berbanding 13% bagi GPT-4o, dan mencapai persentil ke-89 dalam pertandingan Codeforces[3]
- Pendekatan latihan keselamatan baharu membolehkan model menaakul tentang peraturan keselamatan dalam konteks; pada salah satu ujian jailbreak paling sukar OpenAI o1-preview mendapat 84 daripada 100, berbanding 22 bagi GPT-4o[3]
- o1-mini ialah model penaakulan yang lebih pantas dan lebih murah, terutamanya berkesan dalam pengekodan, 80% lebih murah daripada o1-preview[3]
- Pada pelancaran model-model itu tidak mempunyai penyemakan imbas web dan muat naik fail serta imej dalam ChatGPT, dan API tidak mempunyai panggilan fungsi, penstriman dan mesej sistem, dengan akses API untuk pembangun tahap penggunaan 5 pada 20 permintaan seminit[3]
Rujukan 393% KEYAKINANKeyakinan keseluruhan: 93%Sejauh mana sumber dan rujukan pin menyokong tarikhnya.Purata berpemberat bagi sejauh mana 3 rujukan, termasuk sumber, menyokong masa mula dan tamat pin; sesebuah rujukan diambil kira separuh kurang bagi setiap 180 hari lebih lama daripada yang terbaharuTunjuk semua pin pada keyakinan 75% atau lebih baik
Entri pertama sentiasa sumber pin. Keyakinan keseluruhan ialah purata berpemberat bagi sejauh mana setiap rujukan menyokong masa mula dan tamat yang digunakan di atas; sesebuah rujukan diambil kira separuh kurang bagi setiap 180 hari lebih lama daripada yang terbaharu.
- [1]95%OpenAI Model Release Notes: Introducing OpenAI o1-preview and o1-mini (September 12, 2024)help.openai.com· Disiarkan 19 Sep 2026· Bermula 12 Sep 2024· 89% daripada skor
Nota keluaran model OpenAI sendiri menarikhkan entri ini 12 September 2024
- [2]70%AIandBlockchain: AI's Quantum Leap Unpacking OpenAI's O1 Modelspodcasts.apple.com· Diterbitkan 7 Okt 2024· 6% daripada skor
AIandBlockchain's episode "AI's Quantum Leap Unpacking OpenAI's[1] O1 Models" (2024-10-07) says: "a bit unsettling. Join us as we break down the key elements of OpenAI's O1 models, using excerpts from their recently released system card ( September 12th ). We’ll discuss the unique strengths of the O1 Preview and O1 Mini models, highlighting their enhanced ability to handle complex coding tasks, while also"
- [3]88%Introducing OpenAI o1-preview | OpenAI (Wayback Machine copy)web.archive.org· Diterbitkan 12 Sep 2024· 5% daripada skor
Archived copy of OpenAI's[1] o1-preview announcement, which says "GPT-4o correctly solved only 13% of problems, while the reasoning model scored 83%", o1-preview scored 84 on a jailbreaking test, and o1-mini "is 80% cheaper than o1-preview".
Cadangkan pembetulan
Ada yang tertinggal atau salah? Nyatakan dengan kata-kata anda sendiri: pautan yang menyokong pin ini, tarikh mula atau tamat yang berbeza beserta sebabnya, atau fakta yang tiada atau tersilap. AI menyemaknya berbanding sumber pin ini, mencari yang lebih baik, dan menambah mana-mana halaman yang menyokong anda. Sumber pin itu sendiri tetap paling diambil kira. Gambar yang menunjukkan sesuatu yang lain, atau menunjukkannya dengan buruk, turut dilihat, dan dialihkan ke bawah atau diganti.