‹ kembali ke daftar#1 / 64
TECH 30/SEP/2026

OpenAI Rilis GPT-6.1 Sol, Nyaris Selevel GPT-6 Astra dengan Harga Seperlima

OpenAI rilis GPT-6.1 Sol, model AI baru yang diklaim nyaris menyamai GPT-6 Astra di coding, computer use, dan kerja profesional, dengan harga token seperlima.

GPT-6.1 Sol, Upgrade yang Ngaku Nyaris Nyamain Astra

OpenAI baru aja ngerilis sebuah model baru bernama GPT-6.1 Sol. Dari artikel resminya, ini bukan model yang dibangun dari nol, melainkan peningkatan atau upgrade dari GPT-6 Sol yang sudah ada sebelumnya.

Ilustrasi rilis model GPT-6.1 Sol dari OpenAI (kredit: openai.com)
Ilustrasi rilis model GPT-6.1 Sol dari OpenAI (kredit: openai.com)

Klaim besar OpenAI di sini cukup jelas: GPT-6.1 Sol hampir menyamai tingkat kecerdasan GPT-6 Astra, yaitu model yang jadi patokan performa paling tinggi mereka, khususnya di tiga bidang, agentic coding alias ngoding yang dijalankan agen, computer use alias kemampuan mengoperasikan komputer, dan kerja profesional.

Yang bikin klaim itu menarik bukan cuma soal performanya, tapi soal harganya. OpenAI bilang semua itu didapat dengan harga token input dan output standar sekitar seperlima dari GPT-6 Astra. Jadi narasi yang mereka jual adalah "performa dekat level atas, harga jauh lebih murah".

Satu hal yang perlu lo pegang dari awal: semua angka di bawah ini datang dari OpenAI lewat artikel rilis mereka sendiri, bukan dari pengujian independen. Beberapa benchmark-nya memang milik pihak ketiga, tapi skor yang dilaporkan adalah versi OpenAI. Jadi bacanya tetap pakai kepala dingin sampai ada verifikasi dari luar.

Coding: Nyaris Rata Astra, Tapi Lebih Murah

Di tolok ukur DeepSWE v1.1, OpenAI melaporkan GPT-6.1 Sol berhasil menyamai skor GPT-6 Astra, dengan biaya sekitar seperlima. Dibanding GPT-6 Sol, model baru ini bahkan melampaui skor terbaik Sol sebesar 6,4 poin persentase, dan itu dicapai pada tingkat penalaran atau reasoning effort yang lebih rendah, sekaligus dengan biaya yang lebih hemat.

Versi datapoint ini penting buat lo yang kerja di alur agentic coding, karena inti soal model seperti ini bukan cuma bisa jawab soal, tapi bisa ngerjain tugas berantai. Kalau klaim "skor setara dengan biaya seperlima" benar, artinya ongkos menjalankan agen ngoding bisa turun cukup drastis tanpa mengorbankan kualitas.

Kerja Profesional: Benchmark GDP.pdf

Untuk kerja profesional, OpenAI memakai GDP.pdf, benchmark yang dibuat oleh surgehq.ai dan mencakup sepuluh domain, termasuk keuangan, kesehatan, dan hukum, plus tujuh domain lain di luar itu.

Di benchmark ini, OpenAI bilang GPT-6.1 Sol mencetak skor lebih tinggi daripada Opus 5.5 yang dilengkapi mekanisme fallback atau cadangan, dengan biaya per tugas kurang dari setengahnya. Skornya juga disebut mendekati hasil SOTA milik GPT-6 Astra, dengan biaya per tugas sekitar seperlima.

Buat yang belum familier, fallback itu semacam jalur cadangan ketika model utama gagal atau ragu, dan jalur itu biasanya nambah biaya. Jadi poin OpenAI di sini adalah: secara kualitas mereka menang, secara ongkos mereka lebih ringan.

AutomationBench: Selisih Kecil, Biaya Kecil

Benchmark berikutnya adalah AutomationBench versi 1.0.6 yang berasal dari zapier.com dan memuat 47 tool di dalamnya. Di sini GPT-6.1 Sol unggul 2,2 poin persentase di atas Opus 5.5 pada tingkat reasoning medium, dengan biaya sekitar sepertiga. Dibanding GPT-6 Sol pada setting yang sama, skornya naik 4,8 poin persentase.

OpenAI juga menyelipkan catatan soal datapoint Claude Fable 5.1. Menurut mereka, angka itu mengecilkan biaya sebenarnya, karena nggak menghitung biaya fallback yang dipakai di sekitar 40 persen tugas. Perlu dicatat, ini bantahan dari OpenAI sendiri sebagai pihak yang berkepentingan, bukan penilaian netral dari pembuat benchmark. Jadi wajar kalau lo simpan sedikit kecurigaan.

Computer Use: OSWorld 2.0

Untuk kemampuan mengoperasikan komputer, OpenAI memakai OSWorld 2.0, benchmark dari xlang, pada versi offline set dengan partial reward v2026.08.08. GPT-6.1 Sol disebut melampaui GPT-6 Sol sebesar 7 poin persentase pada effort maksimal, dengan biaya kurang dari setengah. Model ini juga berada dalam jarak 2,1 poin persentase dari skor GPT-6 Astra pada effort maksimal, dengan biaya per tugas sekitar sepertujuh.

Ini salah satu klaim yang paling ambisius, karena computer use itu salah satu area paling susah di agent AI. Kalau harga bisa ditekan sampai sekitar sepertujuh sambil tetap dekat dengan level atas, dampaknya ke produk yang menjalankan browser atau aplikasi otomatis lumayan besar.

Sains: Terminal-Bench Science 0.1

Dari sisi penalaran ilmiah, OpenAI memakai Terminal-Bench Science 0.1. Di sini GPT-6.1 Sol disebut lebih dari dua kali lipat skor GPT-6 Sol pada effort maksimal, dengan biaya per tugas kurang dari setengah. Pada effort maksimal, biaya rata-rata per tugas sekitar $5,47, sementara Opus 5.5 sekitar $23,21 dan GPT-6 Astra sekitar $23,80. Itu berarti lebih dari 75 persen lebih murah. Sebagai pembanding, skor tertinggi GPT-6 Astra di benchmark ini adalah 68,1 persen.

Soal Kejujuran: Angka Kesalahan

Satu bagian yang sering dilewatkan orang adalah faktualitas alias seberapa sering model salah fakta. OpenAI bilang peningkatan terbesarnya terjadi pada effort rendah, di mana proporsi respons yang mengandung kesalahan faktual turun dari 11,4 persen jadi 7,7 persen, atau sekitar 32 persen lebih sedikit. Tingkat errornya berada dalam jarak 1,9 poin persentase dari GPT-6 Astra, tapi dengan biaya per tugas kurang dari seperlima.

Buat gue, ini justru lebih relevan buat pemakaian sehari-hari. Sebagian besar orang nggak jalanin model di effort maksimal terus-terusan. Kalau perbaikan terbesarnya ada di effort rendah, berarti mode cepat dan murah itu yang paling kebagian untung.

Keamanan dan Transparansi

OpenAI juga klaim GPT-6.1 Sol lebih transparan soal keterbatasan dirinya, dan punya tingkat kegagalan lebih rendah dibanding GPT-6 Sol pada beberapa hal: transparansi saat tool pencariannya rusak, menghormati batasan eksplisit yang dikasih pengguna, dan menghindari hasil tak terotorisasi dalam tugas agentic.

Mereka bilang model ini nggak ada usaha buat nge-bypass reviewer keamanan otomatis, sama seperti GPT-6 Astra dan GPT-6 Sol. Ada addendum system card yang bisa dibaca di deploymentsafety.openai.com/gpt-6-1-sol.

Satu angka yang cukup telanjang: pada effort maksimal, dalam hal mengungkap kalau tool pencariannya rusak, GPT-6.1 Sol gagal di 2,1 persen kasus, GPT-6 Sol 4,9 persen, GPT-6 Astra 1,5 persen, dan Luna 28,7 persen. Jadi progresnya nyata, tapi tetap belum sebersih Astra.

Harga dan Ketersediaan

Sekarang bagian yang paling gampang dicek. GPT-6.1 Sol tersedia mulai hari ini untuk semua pengguna Plus, Pro, Business, Enterprise, dan Edu di ChatGPT Work dan Codex. Perlu dicatat, model ini belum tersedia di Chat.

Buat developer, model ini bisa diakses lewat API dengan nama gpt-6.1-sol. Harga API standarnya: $2 per juta token input, $0,10 per juta token cached input, dan $10 per juta token output. Angka cached input itu disebut 95 persen lebih murah dari harga input standar, dan 50 persen lebih murah dari cached input GPT-6 Sol.

Dalam beberapa hari ke depan, OpenAI juga bakal nambah varian GPT-6.1 Sol Ultrafast, yang diklaim mampu menghasilkan token sampai 8 kali lebih cepat di Codex.

Jadi, Gimana?

Kalau lo ringkas semuanya, GPT-6.1 Sol adalah langkah OpenAI buat ngerapatkan jarak antara model kelas atas dan model yang lebih murah. Klaimnya: performa yang mendekati GPT-6 Astra, tapi dengan ongkos yang jauh lebih ringan, mulai dari sekitar seperlima untuk harga standar sampai sekitar sepertujuh untuk beberapa tugas.

Tapi ya, semua ini masih klaim satu pihak. Benchmark yang dipakai memang sebagian dari pihak ketiga, tapi angka yang beredar adalah versi OpenAI sendiri, dan mereka punya kepentingan buat bikin modelnya kelihatan sebagus mungkin. Lagipula seluruh penyedia model sekarang ngelakuin hal yang sama, jadi lo nggak perlu panik, cukup nunggu pengujian independen sebelum percaya penuh.

Buat lo yang udah punya akses Plus, Pro, Business, Enterprise, atau Edu, model ini bisa langsung dicoba di ChatGPT Work dan Codex. Yang cuma pakai versi free atau Chat biasa, sabar dulu, karena OpenAI belum bilang kapan model ini masuk ke sana.

Intinya sederhana: kalau klaim "nyaris sekelas frontier tapi seperlima harga" ini ketahuan nyata di ujian independen, dampaknya besar buat siapa pun yang jalanin agent AI dalam skala besar. Tapi hari ini, anggap ini sebagai pembuka babak baru, bukan akhir cerita.

BACA JUGA