- เริ่ม
- 30 ก.ย. 2026ความเชื่อมั่น 90%จาก แหล่งที่มา
ประกาศ Gemini 4 Argon
แปลอัตโนมัติจากต้นฉบับ
ชื่อต้นฉบับ: Gemini 4 Argon Announced
- Google ประกาศ Gemini 4 Argon เมื่อวันที่ 30 กันยายน 2026 โดยเรียกว่าเป็น “โมเดลแนวหน้ารุ่นใหม่” สำหรับงานวิศวกรรมซอฟต์แวร์ในโลกจริง งานด้านความรู้ขององค์กร เช่น กฎหมายและการเงิน และการป้องกันความมั่นคงปลอดภัยไซเบอร์[1]
- โมเดลนี้กำลังทยอยเปิดให้ผู้ป้องกันไซเบอร์ที่ได้รับความไว้วางใจกลุ่มหนึ่งใช้ก่อนผ่านโครงการ Fairwind และ Google เข้าร่วมกระบวนการแบบสมัครใจของรัฐบาลสหรัฐฯ สำหรับการเข้าถึงโมเดลก่อนเปิดตัว ขณะที่ค่อย ๆ ขยายการเข้าถึง[1]
- Google จะเปิดให้นักพัฒนา องค์กร และผู้บริโภคใช้ “โดยเร็วที่สุด” เริ่มจากลูกค้า API แบบชำระเงินและสมาชิก Google AI Ultra ดังนั้นการเปิดตัวทั่วไปจึงยังรออยู่[1]
- ภายในบริษัท โมเดลนี้ขับเคลื่อนเวิร์กโฟลว์ของ Google อยู่แล้ว โดยเอเจนต์คืนหน่วยความจำได้กว่า 300 TiB ในศูนย์ข้อมูลต่าง ๆ ทำได้ดีกว่าค่าฐานของซับรูทีนควอนตัม 40% และช่วยย้ายโค้ด C/C++ ไปเป็น Rust ได้มากถึง 800K+ บรรทัด สำหรับเคอร์เนล Zircon ของระบบปฏิบัติการ Fuchsia[1]
- ในการสาธิตด้านการป้องกันไซเบอร์ โมเดลพบช่องโหว่ร้ายแรงในซอฟต์แวร์ด้านสุขภาพที่โรงพยาบาลทั่วโลกใช้ ซึ่งโมเดลแนวหน้ารุ่นก่อน ๆ พลาดไป[1]
คุณสมบัติเด่น
- ขยายขีดจำกัดเอาต์พุตเป็น 1 ล้านโทเคน จากเดิม 64K เพื่อให้โมเดลให้เหตุผลต่อเนื่องได้หลายแสนโทเคนในเส้นทางเดียว[1]
- ราคาเปิดตัว 2 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ 10 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน โดยอินพุตที่แคชไว้ถูกลง 95% หลังจากนั้นเป็น 4 และ 20 ดอลลาร์ต่อหนึ่งล้านโทเคน[1]
- ทำสถิติใหม่ล่าสุดบน DeepSWE v1.1 ที่ 77.9% (GPT-6 Astra 74.1%, Claude Opus 5.5 74.2%) และเป็นอันดับหนึ่งบน AutomationBench ที่ 51.3% และบน Vals Index ที่ 68.9%[1][2]
- LVBench ความเข้าใจวิดีโอยาว 91.7%, Vals Finance Agent v2 65.4% และ Legal Agent Benchmark ของ Harvey 19.6%[1][2]
- CWE-bench v1 การแก้ไขช่องโหว่ 68.0% เสมออันดับหนึ่ง โดย Google เปิดตัวโดยไม่มีข้อจำกัดด้านไซเบอร์ให้ผู้ป้องกันที่ได้รับความไว้วางใจและทีมของตนเอง[1][2]
- มาตรการป้องกัน: ปฏิเสธคำขอที่เป็นอันตรายโดยยังคงวิทยาศาสตร์ที่ใช้ได้สองทางอย่างถูกต้อง ได้คะแนนสูงสุดในเกณฑ์วัด indirect prompt injection ของ Gray Swan การเฝ้าติดตามห่วงโซ่ความคิดและการกระทำที่หยุดการทำงานนอกขอบเขต และแซนด์บ็อกซ์ที่เสริมความแข็งแกร่ง[1][2]
เกณฑ์วัดประสิทธิภาพ[2]
| เกณฑ์วัด | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index (งานด้านความรู้) | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench (งานด้านความรู้ คะแนน) | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 (งานด้านความรู้) | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark (งานด้านความรู้) | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 (การเขียนโค้ดแบบเอเจนต์) | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 (การเขียนโค้ดแบบเอเจนต์) | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench (การเขียนโค้ดแบบเอเจนต์) | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 (การเขียนโค้ดแบบเอเจนต์) | 57.4% | 58.2% | 57.9% | 66.4% |
| PostTrainBench (วิศวกรรม ML) | 45.3% | 44.3% | 40.2% | 49.3% |
| Terminal-Bench Science 0.1 (วิทยาศาสตร์และคณิตศาสตร์) | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench 2 (วิทยาศาสตร์และคณิตศาสตร์) | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench (วิทยาศาสตร์และคณิตศาสตร์) | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks (บริบทยาว สูงสุด 128k, BFS (F1)) | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks (บริบทยาว 256k ถึง 1M, BFS (F1)) | 84.2% | 71.8% | 65.0% | 66.8% |
| Agent's Last Exam (การใช้คอมพิวเตอร์ อัตราผ่าน) | 39.5% | 34.2% | — | 38.2% |
| OSWorld-2.0 (การใช้คอมพิวเตอร์ ชุดย่อยออฟไลน์ คะแนนบางส่วน) | 69.2% | 72.6% | — | — |
| Chartography (ความเข้าใจหลายรูปแบบ) | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench (ความเข้าใจหลายรูปแบบ) | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 (ความมั่นคงปลอดภัยไซเบอร์) | 68.0% | 68.0% | 58.0% | 67.0% |
แหล่งอ้างอิง 2ความเชื่อมั่น 87%ความเชื่อมั่นโดยรวม: 87%แหล่งที่มาและแหล่งอ้างอิงของหมุดยืนยันวันที่ได้ดีเพียงใดค่าเฉลี่ยถ่วงน้ำหนักว่าแหล่งอ้างอิง 2 แหล่ง รวมแหล่งที่มา สนับสนุนเวลาเริ่มและสิ้นสุดของหมุดมากเพียงใด แหล่งอ้างอิงจะมีน้ำหนักลดลงครึ่งหนึ่งทุก ๆ 180 วันที่เก่ากว่าแหล่งล่าสุดแสดงหมุดทั้งหมดที่มีความเชื่อมั่น 75% ขึ้นไป
รายการแรกคือแหล่งที่มาของหมุดเสมอ ความเชื่อมั่นโดยรวมคือค่าเฉลี่ยถ่วงน้ำหนักว่าแต่ละแหล่งอ้างอิงสนับสนุนเวลาเริ่มและสิ้นสุดด้านบนมากเพียงใด แหล่งอ้างอิงจะมีน้ำหนักลดลงครึ่งหนึ่งทุก ๆ 180 วันที่เก่ากว่าแหล่งล่าสุด
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argonblog.google· โพสต์ 30 ก.ย. 2026· เริ่ม 30 ก.ย. 2026 ✓· 50% ของคะแนน
โพสต์ของ Google ชื่อ “Gemini 4 Argon: our next era of frontier intelligence” ลงวันที่ 30 กันยายน 2026 และระบุว่า “วันนี้ เราขอประกาศโมเดลแนวหน้ารุ่นใหม่ Gemini 4 Argon ซึ่งกำลังทยอยเปิดให้ผู้ป้องกันไซเบอร์ที่ได้รับความไว้วางใจกลุ่มหนึ่ง” ส่วนการเปิดให้นักพัฒนา องค์กร และผู้บริโภคใช้งานทั่วไปจะตามมา “โดยเร็วที่สุด” (ดูพินประมาณการ 4810)
- [2]85%Gemini - Google DeepMinddeepmind.google· เพิ่มเมื่อ 30 ก.ย. 2026· เริ่ม 30 ก.ย. 2026· 50% ของคะแนน
DeepMind's Gemini page now leads with Gemini 4 Argon and carries its benchmark table against GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, plus the four safeguard areas Google is strengthening before broad availability.
เสนอการแก้ไข
มีอะไรขาดหรือผิดไหม บอกด้วยคำพูดของคุณเอง: ลิงก์ที่สนับสนุนหมุดนี้ วันที่เริ่มหรือสิ้นสุดที่ต่างออกไปพร้อมเหตุผล หรือข้อเท็จจริงที่ขาดหรือผิด AI จะตรวจสอบกับแหล่งที่มาของหมุด ค้นหาแหล่งที่ดีกว่า และเพิ่มหน้าที่สนับสนุนคุณ แหล่งที่มาของหมุดเองยังคงมีน้ำหนักมากที่สุด รูปภาพที่แสดงสิ่งอื่นหรือแสดงได้ไม่ดีก็จะถูกตรวจสอบ และเลื่อนลงหรือแทนที่