Tüm diller
Bahasa Indonesia

Yapay zekâ Endonezce dilinde neden daha pahalı?

Aynı şeyi Endonezce söylemek, İngilizce söylemenin 1.36 katı token tutuyor. Sağlayıcılar token başına faturalandırdığı için bu, gönderdiğiniz her prompt'a eklenen %36 demek — daha iyi cevaplar için değil, sadece kodlama yüzünden.

Ölçüm

Token maliyetinde 25 dil içinde 18.
1.36×aynı anlam için İngilizce'den daha fazla token — gönderdiğiniz her prompt'a %36 ek.
GPT-4 / GPT-3.5
1.66×
3.36 karakter/token
GPT-4o / GPT-5
1.36×
4.13 karakter/token

Yeni tokenizer açığın %45'ini kapattı. Bu gerçek bir ilerleme, ama eşitlik değil; eski modeller hâlâ eski tarifeden faturalandırıyor.

Bunun gerçek bir ürüne maliyeti

$2,731yılda, sadece kodlamaya

Ayda 500 bin çağrı, çağrı başına 500 İngilizce token ve milyon girdi token'ı başına 2,50 $ üzerinden. Yalnızca girdi tarafı — çıktı uzunluğu cevabın özelliğidir, dilinizin değil.

Beş farklı metin türünde ölçüldü

Tek cümle hiçbir şey kanıtlamaz; bu yüzden her dilde aynı beş metin ölçülüyor. Ceza, ne yazdığınıza göre 1.09× ile 1.65× arasında değişiyor.

Metin türüTokenİngilizce'ye göre
İş e-postası481.60×
Destek yanıtı491.32×
Ürün açıklaması561.65×
Talimat371.09×
Günlük mesaj461.21×

Bu neden oluyor

Byte-pair encoding, sözlüğünü ezici çoğunluğu İngilizce olan eğitim metninden öğrenir. Sık geçen İngilizce kelime parçaları kendi token'ını kazanır; diğer dillerin ek zincirleri ve çekimleri kazanamaz, bu yüzden kelimeler olması gerekenden fazla parçaya bölünür.

Sık sorulan sorular

Endonezce neden daha fazla token harcıyor?

Tokenizer'lar sözlüklerini ezici çoğunluğu İngilizce olan eğitim metninden öğrenir; bu yüzden İngilizce kelime parçaları kendi token'ını alırken diğer dillerin kelime biçimleri daha küçük parçalara bölünür. Etki mekaniktir, dil hakkında bir yargı değildir.

Bu konuda bir şey yapabilir miyim?

Üç şey işe yarar. Sistem prompt'larını ve talimatları İngilizce yazın, kullanıcıya görünen içeriği Endonezce tutun — model talimatı iki türlü de anlar. Yeni modelleri tercih edin; tokenizer'ları İngilizce dışı metinde belirgin şekilde daha iyi. Ve gereksiz kalıpları temizleyin, çünkü ceza gönderdiğiniz her token'a işliyor, boşa gidenler dahil.

Bu ölçüm mü, tahmin mi?

Ölçüm. Gerçek tokenizer'lar her dilde beş paralel metin üzerinde çalıştırılıyor ve sayımlar kesin. Tek yumuşak girdi çevirinin kendisi; bu yüzden derlem tam olarak yayımlanıyor ve tek bir hoşa giden ortalama yerine beş metin arasındaki yayılım gösteriliyor.

Benzer maliyetli diller

Yöntem: gerçek BPE tokenizer'ları — GPT-4 kuşağı için cl100k_base, GPT-4o ve sonrası için o200k_base — her dilde beş metinden oluşan paralel bir derlem üzerinde çalıştırılıyor. Token sayıları kesindir, tahmin değildir. Çeviriler bize aittir ve depoda tam olarak durur; çünkü daha uzun bir çeviri daha fazla token tüketir ve bizimkini denetleyebilmelisiniz.