İçeriğe geç

Satın alma rehberi

Uygulamaya yapay zekâ eklemek ne kadara mal olur?

Model ücreti maliyetin küçük kısmı. Kullanıcı başına aylık hesabın nasıl kurulduğu, maliyeti düşüren üç mekanizma ve faturayı patlatan üç hata.

Kimin için: Ürününe yapay zekâ özelliği eklemeyi değerlendiren şirketlerSon güncelleme: 8 dk okuma

Kısa cevap

Uygulamaya yapay zekâ eklemek ne kadara mal olur?

Uygulamaya yapay zekâ eklemenin maliyeti üç kalemden oluşur: geliştirme, model kullanımı ve süregelen bakım. Model kullanımı belirteç (token) başına ücretlendirilir ve genellikle en küçük kalemdir; belirleyici olan kullanıcı başına aylık belirteç tüketimidir. Önbellek, model seçimi ve toplu işlem bu tüketimi kat kat düşürür. Neuros bu hesabı ürünün akışına göre çıkarır.

Maliyet nerede oluşuyor?

Üç kalem var ve sıraları çoğu ekibin beklediğinin tersi. Birincisi geliştirme: özelliğin tasarlanması, istemlerin yazılması, değerlendirme setinin kurulması, arayüzün yapılması. İkincisi model kullanımı: her istek için ödenen belirteç ücreti. Üçüncüsü bakım: modeller değişiyor, istemler bayatlıyor, kullanıcı davranışı kayıyor.

Ekiplerin çoğu ikinci kaleme odaklanıyor çünkü tek görünen fiyat listesi o. Oysa küçük ve orta ölçekli bir üründe model faturası genellikle en küçük kalem; asıl para geliştirmeye ve — ilk yıldan sonra — bakıma gidiyor.

Bu sayfa şu aramalara cevap veriyor

  • yapay zeka entegrasyonu maliyeti
  • chatgpt api ücretlendirme
  • uygulamaya yapay zeka eklemek
  • llm token maliyeti hesaplama
  • yapay zeka özelliği ne kadar tutar
  • kendi modelimizi mi çalıştırsak
  • yapay zeka api fiyatları karşılaştırma

Ölçü birimi kullanıcı değil, belirteç

Model ücretlendirmesi belirteç (token) üzerinden yapılıyor: metnin modele giren kısmı girdi, modelin ürettiği kısmı çıktı olarak ayrı fiyatlanıyor ve çıktı her zaman daha pahalı. Bunun pratik sonucu, aynı kullanıcı sayısına sahip iki üründen birinin diğerinden kat kat pahalıya gelmesi.

Farkı yaratan şey akış. Her istekte kırk sayfalık bir dokümanı bağlam olarak gönderen bir ürün, kısa bir soruyu kısa bir cevapla karşılayan üründen onlarca kat fazla belirteç tüketiyor — kullanıcı sayısı aynı olsa bile. Bu yüzden "kaç kullanıcı" sorusu maliyeti tahmin etmeye yetmiyor; "her etkileşimde ne gönderiliyor" sorusu yetiyor.

Aynı ürün, üç farklı akış tasarımı
AkışHer istekte gönderilenGöreli maliyet
Tüm dokümanı her seferinde gönderKırk sayfa bağlam + soruEn yüksek
Bağlamı önbelleğe alAynı bağlam ama önbellekten okunuyorBelirgin biçimde düşük
Yalnızca ilgili parçayı gönderBir–iki sayfa + soruEn düşük

Maliyeti düşüren üç mekanizma

  • **İstem önbelleği.** Her istekte tekrarlanan sabit bağlam — sistem yönergesi, ürün kuralları, doküman — bir kez yazılıp sonraki isteklerde okunuyor. Anthropic'in fiyat sayfasında önbellekten okuma, normal girdi ücretinin yaklaşık onda birine denk geliyor. Tekrar eden bağlamı olan her üründe en büyük tek kaldıraç bu.
  • **Toplu işlem.** Anlık cevap gerekmeyen işler — gece çalışan sınıflandırma, toplu özetleme, veri zenginleştirme — toplu uca gönderildiğinde standart fiyatın yarısına iniyor.
  • **Model bölüştürme.** Sınıflandırma, yönlendirme ve biçimlendirme gibi mekanik adımları küçük modele, muhakeme gerektiren adımı güçlü modele vermek. Tek modelle her şeyi yapan mimari, en pahalı adımın fiyatını her adıma ödetiyor.

Bu üçü birlikte uygulandığında fark yüzde değil kat düzeyinde oluyor. Ama üçü de mimari kararı — özellik yazıldıktan sonra eklenen bir ayar değil. Maliyet optimizasyonunun tasarım aşamasında yapılmasının sebebi bu.

Faturayı patlatan üç hata

  • **API anahtarını uygulamanın içine gömmek.** Mobil uygulamaya gömülen anahtar çıkarılabilir ve çıkarıldığı anda faturayı başkası belirler. Model çağrıları her zaman sizin sunucunuzdan geçmeli; istemci yalnızca sizin uç noktanızı görmeli.
  • **Kullanıcı başına sınır koymamak.** Bir kullanıcının ayda kaç istek yapabileceği tanımlı değilse, tek bir otomatik betik aylık bütçeyi bir günde tüketebiliyor. Sınır ürünün parçası, güvenlik önlemi değil.
  • **Bağlamı büyütmeye devam etmek.** Sohbet geçmişini kırpmadan biriktiren bir akışta her yeni mesaj bir öncekinden pahalı oluyor; maliyet konuşma uzadıkça doğrusal değil birikimli artıyor.

Sabit fiyat verilebilir mi?

Geliştirmeye evet, kullanıma hayır — ve bu ayrımı baştan yapmak iki tarafı da koruyor. Geliştirme kapsamı tanımlanabilir bir iş: özellik, arayüz, değerlendirme seti ve teslim. Model kullanımı ise kullanıcı davranışına bağlı; sabit fiyatlamak, riski fiyata gömüp size fazladan ödetmek demek.

İşleyen kurgu şu: geliştirme sabit fiyat, kullanım ise şeffaf ve ölçülür biçimde doğrudan sağlayıcıya. Üzerine baştan tanımlanmış bir aylık tavan ve tavana yaklaşıldığında tetiklenen bir uyarı. Böylece maliyet ne sürpriz oluyor ne de tahmine bağlı kalıyor.

Kaynaklar

  1. 01Pricing — Claude Developer PlatformAnthropic · 2026
  2. 02GEO: Generative Engine OptimizationPrinceton University · ACM SIGKDD · 2024

Sık sorulan sorular

Merak edilenler

Üç sayıyı çarparak: bir etkileşimin tükettiği ortalama belirteç, kullanıcının ayda kaç kez etkileşime girdiği ve belirteç birim fiyatı. Zor olan kısım ilk sayı — ve onu tahmin etmek yerine ölçmek gerekiyor. Gerçek istemlerinizle birkaç yüz örnek çalıştırıp ortalamayı almak, tablo üzerinde yapılan her tahminden doğru sonuç veriyor. Sitedeki LLM maliyet hesaplayıcı bu çarpımı model model yapıyor.

Bazen olur, bazen daha pahalıya patlar. Ucuz model işi ilk denemede doğru yapamadığında akış yeniden deniyor, kullanıcı soruyu tekrar soruyor ya da arkada bir insan düzeltiyor — üçü de maliyet. Doğru yaklaşım işi bölmek: sınıflandırma, yönlendirme ve biçimlendirme gibi mekanik adımlarda küçük model, muhakeme gerektiren adımda güçlü model. Tek modelle her şeyi yapmak, en pahalı ya da en yanlış sonucu veriyor.

Geliştirme tarafına evet, kullanım tarafına hayır. Geliştirme kapsamı tanımlanabilir bir iştir ve sabit fiyatlanır. Model kullanımı ise kullanıcı davranışına bağlı bir tüketim kalemi; sabit fiyat vermek onu ya abartıp sizi fazla ödetmek ya da eksik hesaplayıp sonra düzeltmek anlamına gelir. Doğru kurgu şu: geliştirme sabit, kullanım şeffaf ve ölçülür, ve baştan bir aylık tavan tanımlanır.

Hacim çok yükseldiğinde ve iş dar bir alana sıkıştığında evet; onun dışında genellikle hayır. Kendi modelinizi çalıştırmak donanım kirasını, çalışır tutma emeğini ve sürüm yükseltme sorumluluğunu üstlenmek demek. Bu üç kalem, düşük ve orta hacimde API ücretinin çok üstünde kalıyor. Ayrıca kalite farkı da maliyet: aynı işi daha kötü yapan bir kurulum, tasarruf ettiğini kullanıcı memnuniyetinden geri veriyor.

Bu adımları birlikte geçelim

Rehberdeki işleri kendi projenizde uygularken yanınızda olalım.