Audvia

Her karakterin ayrı bir yapay zeka sesiyle canlandırıldığı, sahne bazlı ortam sesiyle zenginleştirilen, çok dilli bir yapay zeka sesli kitap platformu.

KAPSAM

Tek ekip. Uçtan uca sorumluluk. Kendi ürünümüz.

3HİZMETALANI

2024PROJEYILI

İSTANBUL / KOCAELİ

Klasik sesli kitapta tek bir anlatıcı vardır, kitabı baştan sona o okur. Audvia bu düzeni bırakıyor. VenusSoft, bir kitabı sinematik bir dinleme deneyimine çeviren üretim ve dağıtım altyapısının tamamını kurdu.

İşin merkezinde tek bir fikir var: kitaptaki her karakter kendi yapay zeka sesiyle konuşsun, dinleyici sahneyi film gibi duysun. Karakter tespiti, ses ataması ve sahne montajı bunun için tek bir üretim hattında birleştirildi. Bir karakterin sesi bölüm ortasında değişirse dinleyicinin kurduğu sahne dağılır, o yüzden üçü ayrı adımlar olarak bırakılmadı.

İkinci katman ortam sesi. Fırtına, tren, sahil, şehir uğultusu. Her biri bölümün içeriğine göre üretiliyor ve anlatımın altına yerleşiyor, ama önüne geçmiyor.

Aynı kitap birden fazla dilde dinlenebiliyor, her dilde o dilin kendi sesleriyle. İçerik, karakter sesleri ve ortam sesleri dilden bağımsız duruyor; üstüne her dil için ayrı bir anlatım katmanı üretiliyor. Tek bir kaydın üzerine altyazı geçilmiyor.

Katalog tek bir türe bağlı değil. Farklı kategorilerdeki kitaplar aynı üretim hattından geçiyor.

Ticari model üç katmanlı. Her kitapta ücretsiz bir önizleme var, sınırsız dinleme için aylık abonelik var, bir de tek seferlik satın alma. Sonuncusunda erişim kalıcı: abonelik biterse kitap sizde kalıyor. Üçü aynı platformda çakışmasın diye yetkilendirme, oynatma katmanından ayrı tutuldu.

Problem, kullanıcı ve kapsam

ÇÖZÜLEN PROBLEM

Geleneksel sesli kitap üretimi tek anlatıcıya, yoğun manuel kurguya ve her dil için yeniden başlayan bir iş akışına dayanıyordu. Audvia’nın çözmesi gereken temel problem; karakter sürekliliğini, sahne atmosferini, çok dilli üretimi ve farklı erişim modellerini tek bir ürün akışında birleştirmekti.

HEDEF KULLANICILAR

  • Karakterleri ayırt edebildiği, daha sinematik bir dinleme deneyimi arayan sesli kitap dinleyicileri
  • Kataloğunu birden fazla dilde yayımlamak ve üretim akışını tekrarlanabilir hâle getirmek isteyen yayın ekipleri
  • Önizleme, abonelik ve kalıcı satın alma modellerini aynı üründe yönetmek isteyen içerik işletmeleri

GELİŞTİRME SÜRESİ

Teknik geliştirme Aralık 2024’te başladı. İlk sürüm ve sonraki ürün iterasyonlarının toplam takvimi kamuya açık olmadığı için doğrulanmamış bir hafta ya da ay bilgisi yayımlanmıyor.

Uygulama ekranları

Aşağıdaki arayüz çalışmaları canlı üründeki temel akışları temsil eder; gerçek kullanıcı, katalog veya ticari veri içermez.

Keşif ve katalog

Dinleyici kategoriler arasında dolaşır, bir kitabın ücretsiz önizlemesine ulaşır ve erişim durumunu tek bakışta görür.

01

Keşif ve katalog

Dinleyici kategoriler arasında dolaşır, bir kitabın ücretsiz önizlemesine ulaşır ve erişim durumunu tek bakışta görür.

Sinematik oynatıcı

Bölüm ilerlemesi, aktif karakter sesi ve sahne atmosferi aynı dinleme ekranında görünür kalır.

02

Sinematik oynatıcı

Bölüm ilerlemesi, aktif karakter sesi ve sahne atmosferi aynı dinleme ekranında görünür kalır.

Üretim akışı

Metin çözümleme, karakter sesi, ortam sesi ve dil sürümleri yayın ekibi için izlenebilir adımlara ayrılır.

03

Üretim akışı

Metin çözümleme, karakter sesi, ortam sesi ve dil sürümleri yayın ekibi için izlenebilir adımlara ayrılır.

Sistem mimarisi

Sistem, kaynak metni oynatılabilir içeriğe dönüştüren üretim hattı ile kataloğu son kullanıcıya ulaştıran dağıtım katmanını ayırıyor. Böylece ses üretimi, dil ekleme ve erişim kararı birbirini kilitlemeden geliştirilebiliyor.

Karşılaşılan teknik zorluklar

  • Aynı karakterin uzun bir kitap boyunca ses kimliğini kaybetmeden devam etmesi
  • Üretilen ortam sesinin sahneyi güçlendirirken konuşmanın önüne geçmemesi
  • Yeni bir dil eklenirken kaynak içerik ile mevcut ses kurgusunun baştan üretilmemesi
  • Önizleme, abonelik ve kalıcı satın alma haklarının birbiriyle çakışmaması

MİMARİ KATMANLAR

  1. 01

    İçerik çözümleme

    Metni sahnelere ve karakter konuşmalarına ayırır; sonraki adımlar için tutarlı bir içerik modeli üretir.

  2. 02

    Yapay zeka ses üretimi

    Her karakterin ses kimliğini koruyarak anlatım katmanlarını dil bazında üretir.

  3. 03

    Sahne ve ses montajı

    Ortam sesini sahne bağlamından üretir, konuşma anlaşılırlığını koruyacak biçimde anlatımla birleştirir.

  4. 04

    Katalog ve yetkilendirme

    Önizleme, abonelik ve kalıcı satın alma haklarını oynatma altyapısından bağımsız değerlendirir.

Ölçülebilir sonuçlar

SİSTEM ÇIKTILARI

  • Tek üretim hattı

    Tekrarlanabilir sesli kitap üretimi

    Karakter tespiti, ses ataması ve sahne montajı ayrı operasyonlar yerine izlenebilir tek akışta birleşti.

  • Dil başına ayrı katman

    Çok dilli anlatım

    Yeni bir dil, kaynak kitabı yeniden kurmadan kendi sesleriyle üretilebilen bağımsız bir anlatım katmanına dönüştü.

  • Üç erişim modeli

    Tek yetkilendirme sistemi

    Ücretsiz önizleme, abonelik ve kalıcı satın alma aynı katalogda birbirinden ayrıştırıldı.

Öne çıkanlar

  • Karakter başına ayrı yapay zeka sesiyle çok sesli, sinematik anlatım

  • Bölümün içeriğine göre üretilen sahne bazlı ortam sesi

  • Aynı kitabın her dilde o dilin kendi sesleriyle sunulması

  • Türden bağımsız, her kitap kategorisine açık katalog

  • Ücretsiz önizleme, abonelik ve kalıcı satın almadan oluşan üç katmanlı erişim

Kullanılan teknolojiler

  • Karakter tespiti ve ses atamasını birleştiren özel üretim hattı
  • Sahne içeriğine duyarlı otomatik ortam sesi üretimi
  • Dilden bağımsız içerik ve anlatım mimarisi
  • Abonelik ile kalıcı satın almayı aynı anda taşıyan yetkilendirme sistemi

Sıkça sorulan sorular

Her karakterin ayrı sesle okunması pratikte nasıl çalışıyor?

Metin önce karakterlerine ayrılıyor. Hangi replik kime ait, tespit ediliyor; her karaktere kendi yapay zeka sesi atanıyor; sahne montajı bu atamaya göre yapılıyor. Üçü tek bir üretim hattının parçası, çünkü bir karakterin sesi bölüm ortasında değişirse dinleyicinin kurduğu sahne dağılır. Ortaya replikleri birbirinden ayrılabilen çok sesli bir anlatım çıkıyor.

Ortam sesleri hazır bir ses kütüphanesinden mi seçiliyor?

Hayır, sahnenin içeriğine göre üretiliyor. Bölümde fırtına varsa fırtına, tren varsa tren, kalabalık bir cadde varsa şehir gürültüsü anlatımın altına biniyor. Dinleyicinin sahneyi film gibi duyması için var, o yüzden anlatımın önüne geçmeyecek biçimde katmanlanıyor.

Aynı kitap birden fazla dilde nasıl sunuluyor?

İçerik, karakter sesleri ve ortam sesleri dilden bağımsız bir yapıda duruyor. Her dil için ayrı bir anlatım katmanı üretiliyor, yani dil eklemek kitabı baştan kurmak anlamına gelmiyor. Her dilde anlatım o dilin kendi yapay zeka sesleriyle yapılıyor; tek bir kaydın üzerine altyazı geçilmiyor.

Katalog belirli bir kitap türüyle sınırlı mı?

Sınırlı değil. Üretim hattı türden bağımsız kuruldu, farklı kategorilerdeki kitaplar aynı hattan geçiyor. Bu bilinçli bir karardı: platformu tek bir türe bağlamak, o tür tükendiğinde altyapıyı yeniden yazmak demekti.

Erişim modeli nasıl kurgulandı?

Üç katmanlı. Her kitapta ücretsiz bir önizleme, sınırsız dinleme için abonelik, bir de tek seferlik satın alma. Sonuncusunda erişim kalıcı: abonelik iptal edilse bile kitap kullanıcıda kalıyor. Üçü çakışmasın diye yetkilendirme oynatma katmanından ayrıldı. «Bu kişi bunu dinleyebilir mi» sorusu, «bu ses nasıl çalınır» sorusundan bağımsız cevaplanıyor.

Audvia benzeri bir içerik ürünü mü planlıyorsunuz?

Yapay zeka üretim hattı, çok dilli katalog ve erişim modeli gerektiren ürününüzün teknik kapsamını birlikte çıkaralım.

Projenizi konuşalım