Rehberlik ve içgörü

Yapay Zeka Model Seçimi için Ağ Geçidi Tarafından Yönetilen Değerlendirmeler: Sessiz Gerilemeler Olmadan Daha Ucuz veya Daha Hızlı Modelleri Teşvik Edin

Çok modelli bir API ağ geçidi aracılığıyla modelleri değiştirmek umut değil, kanıt gerektirmelidir. Gerçek izlemelerden değerlendirme veri kümeleri oluşturun, adayları deterministik ve değerlendirmeye dayalı kontrollerle derecelendirin ve terfi kararlarını ağ geçidi kontrol düzleminin bir parçası haline getirin.

Ekipler genellikle bir modeli açıkça kötü olan bir modelle değiştirerek yapay zeka iş akışlarını bozmazlar. Daha ucuz, daha hızlı veya daha erişilebilir görünen makul bir yönlendirme değişikliği yaparak ve daha sonra özetlerin daha az güvenilir olduğunu, araç çağrılarının hatalı biçimlendirildiğini veya küçük ama önemli bir kiracı iş yükü için reddetme davranışının değiştirildiğini keşfederek bu kuralları bozarlar.

Pratik yanıt, değerlendirme sonuçlarını ağ geçidinin içindeki bir promosyon yapısı olarak ele almaktır. Bir model takma adı, kiracı profili veya yönlendirme politikası yeni bir adayı işaret etmeden önce, ağ geçidinin hangi veri kümesinin kullanıldığını, hangi not verenlerin çalıştığını, adayın mevcut temel ile nasıl karşılaştırıldığını, maliyet ve gecikme etkisinin ne olduğunu, değişikliği kimin onayladığını ve bunun nasıl geri alınacağını gösterebilmesi gerekir.

Bu makalede, yapay zeka modeli seçimi için ağ geçidi tarafından yönetilen değerlendirmelere yönelik bir referans modeli açıklanmaktadır. Karşılaştırma takibine değil, üretim kontrolüne odaklanır.

Gerçekler, Öneriler ve Tahminler

Gerçekler: Modern değerlendirme araçları, yeniden kullanılabilir değerlendirme veri kümelerini tanımlayabilir, birden fazla model yapılandırması çalıştırabilir ve çıktı düzeyinde derecelendirme sonuçlarını, geçiş durumunu, jeton sayımlarını ve toplu metrikleri döndürebilir. Yaygın olarak kullanılan not verici türleri arasında tam dize kontrolleri, benzerlik ölçümleri, şema veya hesaplama kontrolleri ve model tabanlı notlayıcılar bulunur. İkili değerlendirme, aday yanıtlarını bir temel çizgiye göre karşılaştırabilir; noktasal değerlendirme ise bir değerlendirme tablosuna veya beklenen yanıta göre bir yanıtı puanlar.

Öneriler: Geçerli JSON, gerekli alanlar, izin verilen etiketler, araç argüman şekli, alıntı varlığı, ret kategorisi veya sayısal tolerans gibi görevin açık bir sözleşmesinin olduğu yerlerde deterministik not vericiler kullanın. Açık uçlu kalite için model tabanlı değerlendirmeleri yalnızca küçük bir insan derecelendirmeli setle karşılaştırdıktan sonra kullanın. Yalnızca kamuya açık bir karşılaştırmaya dayalı bir modeli tanıtmayın; bunu kendi izlerinize, kiracılarınıza, araçlarınıza, bütçelerinize ve hata modlarınıza bağlı kanıtlardan destekleyin.

Tahminler: Model tanıtımı, anlık uygulama kararlarından ağ geçidi kontrol düzlemlerine geçecektir çünkü ağ geçitleri model değişikliklerini denetlenebilir kılmak için gereken model kataloğunu, yönlendirme kurallarını, kullanım izlerini, kiracı politikalarını ve faturalandırma verilerini zaten içerir. Değerlendirmeleri yönlendirmeden ayrı tutan ekipler yine de testler yürütecek ancak hangi kanıtın canlı bir takma ad değişikliğini desteklediğini kanıtlamakta zorlanacaklar.

Okuyucu Sorunu: Yönlendirme Değişiklikleri Kanıta İhtiyaç Duyar

Çok modelli bir API, hedef modeli değiştirmeyi kolaylaştırır. Bu faydalıdır ancak aynı zamanda bir kontrol sorunu da yaratır. Bir ekip, yüksek maliyetli destek özetleme modelini daha ucuz bir adayla değiştirmek, kullanılabilirlik için bir yedek model eklemek, kodlama görevlerini daha hızlı bir modele taşımak veya düşük öncelikli kiracıları daha düşük maliyetli bir katmana yönlendirmek isteyebilir.

Her değişikliğin farklı bir risk profili vardır. Daha ucuz bir özetleyici, yükseltme ayrıntılarını atlayabilir. Daha hızlı bir sınıflandırıcı nadir etiketleri yanlış işleyebilir. Bir geri dönüş modeli farklı bir araç çağrısı formatı kullanabilir. Daha yeni bir akıl yürütme modeli, p95 gecikmesini artırırken zor durumları iyileştirebilir. Sağlayıcı sürüm notları ve herkese açık liderlik tabloları, bu ödünleşimlerin belirli bir uygulama için kabul edilebilir olup olmadığına yanıt veremez.

Ağ geçidi, istekleri, yanıtları, kiracıları, anahtarları, takma adları, maliyetleri, gecikmeyi, hata oranlarını, araç çağrılarını ve politika kararlarını gördüğü için bu açığı kapatacak doğal yerdir. Ağ geçidi tarafından yönetilen değerlendirmeler, operasyonel bağlamı tekrarlanabilir bir tanıtım iş akışına dönüştürür.

Referans Mimarisi

Pratik bir mimari yedi bölümden oluşur:

  1. İzleme örnekleyici: üretim trafiğinden, başarısız isteklerden, pahalı isteklerden, kiracı onaylı örneklerden ve bilinen uç durumlardan aday değerlendirme öğelerini seçer.
  2. Düzenleme ve izin kontrolleri: hassas alanları kaldırır veya maskeler, kiracıyı zorunlu kılar günlük kaydı ve saklama politikası ve değerlendirmeler için kullanılamayan örnekleri engeller.
  3. Veri kümesi kaydını değerlendir: görev türü, kiracı kapsamı, bilgi istemi şablonu sürümü, araç şeması sürümü, mümkün olduğunda beklenen çıktılar ve kaynak ile değişmez veri kümesi sürümlerini saklar.
  4. Aday model çalıştırıcı: kontrollü kullanarak veri kümesi öğelerini geçerli temele ve bir veya daha fazla aday modele göre yeniden oynatır. parametreler.
  5. Notlandırıcılar: deterministik kontroller, hesaplamaya dayalı metrikler ve kalibre edilmiş modele dayalı değerlendirme uygular.
  6. Promosyon karar kaydı: değerlendirme çalıştırma kimliğini, veri kümesi sürümünü, temel model kimliğini, aday model kimliğini, sınıflandırıcı sürümlerini, eşikleri, sonuçları, sahibi, onayı ve geri alma hedefini yakalar.
  7. Takma ad veya yönlendirme politikası güncellemesi: canlı ağ geçidi ancak tanıtım kararı gerekli geçitleri geçtikten sonra gerçekleşir.

Bu, değerlendirmelerin dağıtıma bağlı kalmasını sağlar. Değerlendirme çalıştırması birisinin sohbet dizisine yapıştırdığı bir rapor değildir.support-fast, coding-default veya summarize-cheap gibi bir takma adı değiştirmeden önce gereken bir kontrol düzlemi nesnesidir.

Üç Veri Kümesi Sınıfı Oluşturun

1. Altın Regresyon Vakaları

Altın vakalar, beklenen yanıtlara veya katı başarı kriterlerine sahip seçilmiş örneklerdir. Manuel olarak incelenecek kadar küçüktürler ve önerilen her promosyonda çalıştırılacak kadar kararlıdırlar.

Bunları net sözleşmelere sahip görevler için kullanın: sınıflandırma, çıkarma, yapılandırılmış özetler, politika kararları, araç seçimi, yönlendirme etiketleri ve reddetme davranışı. Altın öğe; girdiyi, beklenen çıktıyı veya değerlendirme tablosunu, izin verilen varyasyonu, görev meta verilerini ve çağrıyı yeniden oluşturmak için gereken araç şemalarını içermelidir.

Örnek alanlar:

{
  "dataset_item_id": "destek özeti-0421",
  "görev": "destek_özeti",
  "kiracı_kapsamı": "paylaşılan_redacted",
  "giriş_mesajları": [...],
  "beklenen_şema": "destek_özet_v3",
  "required_facts": ["refund_requested", "order_id_current", "escalation_reason"],
  "disallowed_content": ["invented_refund_status"],
  "prompt_template_version": "support_summary_prompt_2026_08_14"

2. Üretimden Türetilen Uç Durumlar

Üretimden türetilen durumlar, sentetik testlerin genellikle gözden kaçırdığı hataları yakalar. İyi kaynaklar arasında yüksek maliyetli istekler, yeniden denemeler, manuel geçersiz kılmalar, kullanıcı düzeltmeleri, güven düzeyi düşük sınıflandırıcı çıktıları, şema hataları, uzun bağlam çağrıları, gecikme sınırlarına yaklaşan istekler ve olağandışı araç kullanımına sahip kiracı iş akışları yer alır.

Gizlilik kuralı basittir: üretim izlemeleri yalnızca izin verildiği takdirde faydalıdır. Ağ geçidi, bir izlemenin değerlendirme veri kümesine girmesinden önce kiracının onayını, veri saklama ilkesini, düzenlemeyi ve ikamet kısıtlamalarını zorunlu kılmalıdır. Hassas kiracılar, ortam içi değerlendirme yürütmeye, sentetik eşdeğerlere veya ham istemleri ve tanımlayıcıları kaldıran düzeltilmiş izlere ihtiyaç duyabilir.

3. Çekişmeli ve Politika Vakaları

Çekişmeli vakalar, baskı altında başarısız olan davranışları test eder: aracın yanlış kullanımı, anında enjeksiyon, güvenli olmayan ifşa, ret sınırları, gizli talimat çakışmaları, hatalı biçimlendirilmiş dosyalar, geçersiz alıntılar ve belirsiz kullanıcı istekleri. Bu vakaların dramatik olmasına gerek yok. Bir model fazla hoşgörülü, fazla itaatkar veya fazla dikkatsiz hale geldiğinde uygulamalarınızın zarar verebileceği yolları temsil etmeleri gerekir.

Ajanlı iş akışları için yalnızca tek dönüşlü istemleri değil, tam mesaj geçmişlerini ve araç çağrısı bağlamını dahil edin. Tek dönüşlü bir soruyu iyi yanıtlayan bir aday, araç sonuçlarını incelemesi, yetki sınırlarını koruması ve sonraki bir eylem için geçerli argümanlar üretmesi gerektiğinde yine de başarısız olabilir.

Önce Deterministik Not Vericileri Kullanın

Yargı gerektirmeyen not verenlerle başlayın. Bunlar daha ucuzdur, daha hızlıdır, hata ayıklaması daha kolaydır ve sapma olasılığı daha düşüktür.

Yararlı deterministik kontroller şunları içerir:

  • JSON başarılı bir şekilde ayrıştırır ve gerekli şemayla eşleşir.
  • Gerekli alanlar mevcut ve hiçbir yasaklı alan görünmüyor.
  • Sınıflandırma çıktısı izin verilen etiketlerden biridir.
  • Sayısal yanıt kabul edilen bir tolerans dahilindedir.
  • Kiracı için araç adına izin verilir ve iş akışı.
  • Araç bağımsız değişkenleri şema doğrulamasını ve politika kontrollerini geçer.
  • Yanıt, gerekli alıntıları veya kaynak tanımlayıcıları içerir.
  • Yanıt, bilinen yasaklı ifadeleri, sırları veya dahili işaretleri içermez.
  • Ret kategorisi, beklenen politika sonucuyla eşleşir.

Bu kontroller katı tanıtım kapıları olmalıdır. Bir aday geçerli yapılandırılmış çıktılar veya güvenli araç çağrıları üretemezse, iyi bir açık uçlu yazma puanının onu kurtarmaması gerekir.

Modele Dayalı Değerlendirmeleri Dikkatli Kullanın

Açık uçlu görevler hâlâ kaliteli muhakeme gerektirir. Özetler aslına uygun olabilir ancak kesin olmayabilir. Destek yanıtlarının üslup, eksiksizlik ve politika uyumuna ihtiyacı olabilir. Kodlama yardımı, temel bir yanıtla ikili karşılaştırma gerektirebilir.

Modele dayalı değerlendirmeler bu katman için faydalıdır ancak nesnel gerçek olarak ele alınmamalıdır. Üretim değişikliklerini engellemeden veya onaylamadan önce bunları insan tarafından derecelendirilen küçük bir numuneye göre kalibre edin. Hakemin, iş akışının risk seviyesi için yeterince sık insan etiketleri ile aynı fikirde olup olmadığını kontrol edin.İkili jüri üyeleri için konum önyargısına, ayrıntı tercihine ve her iki cevabın da kabul edilemez olduğunu fark etmemeye dikkat edin.

Destek özeti için pratik bir jüri değerlendirme listesi şu puanları verebilir:

  • Sadakat: Özet, görüşmede mevcut olmayan gerçekleri eklemekten kaçınıyor mu?
  • Tamlık: Müşteri sorununu, talep edilen eylemi, ilgili sipariş ayrıntılarını ve sonraki hususları içeriyor mu? adım?
  • İşlem yapılabilirlik: Bir temsilci, ileti dizisinin tamamını yeniden okumadan bunu kullanabilir mi?
  • Politika uyumu: Onaylanmayan geri ödemeler, krediler veya üst kademelere iletmeyi vaat etmekten kaçınıyor mu?

Promosyon için, puan bazında minimum puanları ikili karşılaştırmayla birleştirin. İkili kazanma oranı, bir temel çizgiyi değiştirirken faydalıdır, ancak her iki yanıtın da kötü olması durumunda mutlak başarısızlıkları gizleyebilir. İkili kalite, mevcut modelden daha iyi, eşdeğer veya daha kötü olduğuna karar vermeden önce adayın minimum başarılı/başarısız geçitlerini karşılaması gerekir.

Bir Promosyon Puan Kartı Tanımlayın

Bir ağ geçidi promosyon puan kartı kalite, gecikme, maliyet ve operasyonel güvenliği birleştirmelidir. Kesin eşikler iş yüküne bağlıdır, ancak puan kartı çalıştırma başlamadan önce açıkça belirtilmelidir.

Her aday model için şunu izleyin:

  • Kalite geçiş oranı: gerekli belirleyici ve dereceli puanlama anahtarı geçitlerini geçen veri kümesi öğelerinin yüzdesi.
  • İkili kazanma oranı: açık uçlu kaliteye ilişkin mevcut taban çizgisine karşı aday.
  • p95 gecikmesi: temsili ağ geçidi altında ölçülür ayarlar.
  • Başarılı görev başına tahmini maliyet: toplam tahmini maliyetin ham çağrılara değil, kabul edilen çıktılara bölünmesi.
  • Yapılandırılmış çıktı geçerliliği: şema geçiş hızı ve onarım oranı.
  • Araç çağrısı geçerliliği: izin verilen araç kullanımı, geçerli argümanlar ve politikaya uygun eylem seçimi.
  • Güvenlik veya politika hataları: retler, güvensiz tamamlamalar, veri sızıntısı işaretleri veya kiracı politikası ihlalleri.
  • Operasyonel uyumluluk: akış davranışı, durdurma dizileri, belirteç sınırları, zaman aşımları ve sağlayıcıya özel yanıt alanları.

Başarılı görev başına maliyet, belirteç başına maliyetten daha önemlidir. Şema doğrulamasında yüzde 12 oranında başarısız olan daha ucuz bir model, yeniden denemeler, onarımlar, manuel inceleme ve destek yükseltmelerinden sonra daha pahalı hale gelebilir. Ağ geçidi, bunu doğru bir şekilde hesaplamak için gereken faturalandırma ve kullanım analitiğine sahiptir.

Örnek: Destek Özetleme Modelini Değiştirme

Geçerli support-fast takma adının, müşteri konuşmalarını katı bir JSON nesnesinde özetlemek için kullanılan yüksek maliyetli bir modele işaret ettiğini varsayalım. Ekip daha ucuz bir adayı terfi ettirmek istiyor.

Tanıtım iş akışı şu şekilde görünebilir:

  1. 200 altın vaka, 300 redakte edilmiş üretim uç vakası ve 100 rakip politika vakası ile support_summary_eval_2026_09_02 veri kümesi sürümünü oluşturun.
  2. Mevcut temel çizgiyi ve daha ucuz adayı aynı bilgi istemi şablonu, şeması, maksimum ile çalıştırın. çıktı jetonları ve araç kullanılabilirliği.
  3. Belirleyici geçitler uygulayın: Yüzde 99 veya daha yüksek JSON geçerliliği, yüzde 97 veya daha yüksek düzeyde gerekli bilgi kapsamı, sıfır yasak geri ödeme vaadi ve sıfır geçersiz araç eylemi.
  4. Modele dayalı ikili değerlendirmeyi yalnızca deterministik kontrolleri geçen öğelere uygulayın.
  5. Adayın taban çizgisine göre tanımlanmış bir kalite marjından daha fazla kaybetmemesini, mevcut p95 gecikme bütçesinin altında kalmasını ve Kabul edilen özet başına tahmini maliyet.
  6. Değerlendirme çalıştırma kimliğini, veri kümesi sürümünü, sınıflandırıcı sürümlerini, aday model kimliğini, temel model kimliğini, eşikleri, onaylayanı ve geri alma takma adı hedefini kaydedin.
  7. Sınırlı bir kiracı grubu için takma adı canary yapın, canlı şema hatalarını izleyin ve düzeltmeleri destekleyin, ardından genişletin veya geri alın.

Önemli nokta, adayın daha ucuz olduğu için kabul edilmemesidir. Yalnızca değerlendirme kanıtı, daha ucuz modelin görev sözleşmesi kapsamında kaldığını gösteriyorsa kabul edilir.

Promosyon Kayıtlarını Değiştirilemez Hale Getirin

Ağ geçidi daha sonraki bir olay sorusunu yanıtlamak için yeterli ayrıntıyı korumalıdır: Bu model neden tanıtıldı?

Bir promosyon kararı kaydı şunları içermelidir:

  • Promosyon kimliği ve değişmez değerlendirme çalıştırma kimliği.
  • Veri kümesi kimliği, veri kümesi sürümü ve veri kümesi. kaynak.
  • Temel model kimliği ve aday model kimliği.
  • İstem şablonu sürümü ve parametre kümesi.
  • Araç şeması sürümleri ve yönlendirme kısıtlamaları.
  • Not veren adları, sürümleri, eşikler ve kalibrasyon notları.
  • Toplu sonuçlar ve başarısız öğe referansları.
  • Maliyet ve gecikme tahminleri.
  • Kiracı kapsamı ve kullanıma sunma kapsam.
  • Onaylayıcı, zaman damgası ve geri alma hedefi.

Bu özellikle takma adlar için önemlidir.Uygulama ekipleri, sağlayıcı model kimliği yerine hızlı destek'i çağırırsa kararlılık elde ederler, ancak artık takma ad değişikliklerinin yönetildiğini kanıtlama görevi ağ geçidine aittir.

Gizlilik ve Saklama Denetimleri

Üretim izleme değerlendirmeleri, gizlilik yükümlülükleri getirir. Bir izleme örnekleyici, değerlendirmelerin dahili olması nedeniyle hiçbir zaman kiracı politikasını atlamamalıdır. Bir değerlendirme öğesini saklamadan veya dışa aktarmadan önce, ham istemlerin tutulup tutulamayacağını, sağlayıcı tarafından barındırılan değerlendirme araçlarına izin verilip verilmediğini, verilerin belirli bir bölgede kalması gerekip gerekmediğini ve örneğin gizli bilgiler, düzenlenmiş veriler veya müşteri tanımlayıcıları içerip içermediğini kontrol edin.

Hassas iş yükleri için daha güvenli üç modelden birini kullanın:

  • Barındırılan değerlendirme ürünlerine ham izler göndermeden değerlendirmeleri ağ geçidi ortamında çalıştırın.
  • Yapıyı koruyan, düzenlenmiş izleri kullanın. ve hata modunu kaldırın ancak hassas alanları kaldırın.
  • Üretim içeriğini kopyalamadan, gözlemlenen hata modellerinden sentetik vakalar oluşturun.

Değişim gerçektir. Üretimden türetilen değerlendirmeler iş yüküne özgü regresyonları yakalar. Sentetik değerlendirmeler maruz kalmayı azaltır. Çoğu ekibin her ikisine de ihtiyacı vardır.

Uygulama Kontrol Listesi

  • Model tanıtımını bir not defteri alıştırması olarak değil, kontrol düzlemi iş akışı olarak tanımlayın.
  • Sürüm veri kümeleri, istemler, araç şemaları, sınıflandırıcılar ve eşikler.
  • Altın, üretimden türetilmiş ve çekişmeli durumları ayırın.
  • Model tabanlıdan önce deterministik sınıflandırıcıları çalıştırın. yargıçlar.
  • Yüksek etkili iş akışları için yargıçları insan tarafından derecelendirilen örneklere göre kalibre edin.
  • Yalnızca belirteç başına maliyeti değil, kabul edilen görev başına maliyeti de ölçün.
  • Takma ad veya yönlendirme politikası değişikliklerinden önce geri alma hedeflerini zorunlu kılın.
  • Denetim ve olay incelemesi için promosyon kayıtlarını koruyun.
  • İzleme tabanlı için kiracı onayı, saklama ve ikamet kısıtlamalarına saygı gösterin. değerlendirmeler.
  • Değerlendirmeler riski azalttığı ancak ortadan kaldırmadığı için canlı kanaryaları izleyin.

Sonuç

Yapay zeka modeli seçimi genel karşılaştırmalara, sürüm notlarına veya tek bir geliştiricinin manuel karşılaştırmasına bağlı olmamalıdır. Çok modelli bir API ağ geçidinde model değişiklikleri kiracıları, bütçeleri, gecikmeyi, araç davranışını, yapılandırılmış çıktıları ve güvenlik politikasını etkiler. Bu, değerlendirmeleri üretim yönetiminin bir parçası haline getirir.

İşlem yapılabilir model basittir: temsili izleri örnekleyin, bunları politikaya göre düzenleyin ve filtreleyin, değerlendirme veri kümesini sürümlendirin, temel çizgiyi ve adayları çalıştırın, önce deterministik kontrollerle not verin, açık uçlu kalite için kalibre edilmiş değerlendirmeler kullanın, kaliteyi gecikme ve maliyetle birleştirin ve takma adları veya yönlendirme kurallarını değiştirmeden önce değişmez bir tanıtım kaydı gerektirir.

Sonuç, modelin benimsenmesinde daha yavaş bir süreç değildir. Kanıtlarla birlikte modelin benimsenmesidir. Daha ucuz ve daha hızlı adaylar hâlâ üretime geçebilir ancak tasarrufların sessiz görev regresyonundan gelmediğini kanıtlamaları gerekir.

İlgili okuma

FAQ

Sık sorulan sorular

Her model değişikliği tam bir değerlendirme çalışması gerektirmeli mi?
Hayır. Düşük riskli değişiklikler daha küçük bir regresyon kümesi kullanabilirken, üretim iş akışlarına yönelik takma ad değişikliklerinin eksiksiz bir promosyon puan kartı gerektirmesi gerekir. Ağ geçidi, değişiklik riskini kiracı kapsamına, görevin kritikliğine, araç yetkisine ve beklenen maliyet etkisine göre sınıflandırmalıdır.
Yapay zeka modeli seçimi için ikili jüri üyeleri yeterli mi?
Hayır. İkili değerlendirmeler, bir adayı mevcut temel çizgiyle karşılaştırmak için faydalıdır, ancak mutlak başarısızlıkları gözden kaçırabilirler. İkili sonuçları, şema geçerliliği, araç çağrısı geçerliliği, gerekli olgu kapsamı ve güvenlik kontrolleri gibi deterministik başarılı/başarısız kapılarıyla birleştirin.
Ekipler hassas üretim izlerini nasıl ele almalı?
Saklama, ikamet ve eğitim-kullanım gereksinimleri uyumlu olmadığı sürece, ham hassas istemleri barındırılan değerlendirme araçlarına göndermeyin. Hassas kiracılar için, ağ geçidi ortamında değerlendirmeler çalıştırın, düzeltilmiş izleri kullanın veya gözlemlenen hata modellerinden sentetik vakalar oluşturun.
Değerlendirmeleri maliyet optimizasyonuna en iyi şekilde bağlayan metrik hangisidir?
Başarılı görev başına tahmini maliyeti kullanın. Daha ucuz bir model yeniden denemelere, şema onarımlarına, manuel incelemeye veya daha düşük görev tamamlama kalitesine neden olduğunda token fiyatı tek başına yanıltıcı olabilir.