Audvia
Her karakterin ayrı bir yapay zeka sesiyle canlandırıldığı, sahne bazlı ortam sesiyle zenginleştirilen, çok dilli bir yapay zeka sesli kitap platformu.
KAPSAM
Tek ekip. Uçtan uca sorumluluk. Kendi ürünümüz.
3HİZMETALANI
2024PROJEYILI
İSTANBUL / KOCAELİ
Ne yapıldı
- YIL
- 2024
Klasik sesli kitapta tek bir anlatıcı vardır, kitabı baştan sona o okur. Audvia bu düzeni bırakıyor. VenusSoft, bir kitabı sinematik bir dinleme deneyimine çeviren üretim ve dağıtım altyapısının tamamını kurdu.
İşin merkezinde tek bir fikir var: kitaptaki her karakter kendi yapay zeka sesiyle konuşsun, dinleyici sahneyi film gibi duysun. Karakter tespiti, ses ataması ve sahne montajı bunun için tek bir üretim hattında birleştirildi. Bir karakterin sesi bölüm ortasında değişirse dinleyicinin kurduğu sahne dağılır, o yüzden üçü ayrı adımlar olarak bırakılmadı.
İkinci katman ortam sesi. Fırtına, tren, sahil, şehir uğultusu. Her biri bölümün içeriğine göre üretiliyor ve anlatımın altına yerleşiyor, ama önüne geçmiyor.
Aynı kitap birden fazla dilde dinlenebiliyor, her dilde o dilin kendi sesleriyle. İçerik, karakter sesleri ve ortam sesleri dilden bağımsız duruyor; üstüne her dil için ayrı bir anlatım katmanı üretiliyor. Tek bir kaydın üzerine altyazı geçilmiyor.
Katalog tek bir türe bağlı değil. Farklı kategorilerdeki kitaplar aynı üretim hattından geçiyor.
Ticari model üç katmanlı. Her kitapta ücretsiz bir önizleme var, sınırsız dinleme için aylık abonelik var, bir de tek seferlik satın alma. Sonuncusunda erişim kalıcı: abonelik biterse kitap sizde kalıyor. Üçü aynı platformda çakışmasın diye yetkilendirme, oynatma katmanından ayrı tutuldu.
Problem, kullanıcı ve kapsam
ÇÖZÜLEN PROBLEM
Geleneksel sesli kitap üretimi tek anlatıcıya, yoğun manuel kurguya ve her dil için yeniden başlayan bir iş akışına dayanıyordu. Audvia’nın çözmesi gereken temel problem; karakter sürekliliğini, sahne atmosferini, çok dilli üretimi ve farklı erişim modellerini tek bir ürün akışında birleştirmekti.
HEDEF KULLANICILAR
- Karakterleri ayırt edebildiği, daha sinematik bir dinleme deneyimi arayan sesli kitap dinleyicileri
- Kataloğunu birden fazla dilde yayımlamak ve üretim akışını tekrarlanabilir hâle getirmek isteyen yayın ekipleri
- Önizleme, abonelik ve kalıcı satın alma modellerini aynı üründe yönetmek isteyen içerik işletmeleri
GELİŞTİRME SÜRESİ
Teknik geliştirme Aralık 2024’te başladı. İlk sürüm ve sonraki ürün iterasyonlarının toplam takvimi kamuya açık olmadığı için doğrulanmamış bir hafta ya da ay bilgisi yayımlanmıyor.
Uygulama ekranları
Aşağıdaki arayüz çalışmaları canlı üründeki temel akışları temsil eder; gerçek kullanıcı, katalog veya ticari veri içermez.
Keşif ve katalog
Dinleyici kategoriler arasında dolaşır, bir kitabın ücretsiz önizlemesine ulaşır ve erişim durumunu tek bakışta görür.
Sinematik oynatıcı
Bölüm ilerlemesi, aktif karakter sesi ve sahne atmosferi aynı dinleme ekranında görünür kalır.
Üretim akışı
Metin çözümleme, karakter sesi, ortam sesi ve dil sürümleri yayın ekibi için izlenebilir adımlara ayrılır.
Sistem mimarisi
Sistem, kaynak metni oynatılabilir içeriğe dönüştüren üretim hattı ile kataloğu son kullanıcıya ulaştıran dağıtım katmanını ayırıyor. Böylece ses üretimi, dil ekleme ve erişim kararı birbirini kilitlemeden geliştirilebiliyor.
Karşılaşılan teknik zorluklar
- Aynı karakterin uzun bir kitap boyunca ses kimliğini kaybetmeden devam etmesi
- Üretilen ortam sesinin sahneyi güçlendirirken konuşmanın önüne geçmemesi
- Yeni bir dil eklenirken kaynak içerik ile mevcut ses kurgusunun baştan üretilmemesi
- Önizleme, abonelik ve kalıcı satın alma haklarının birbiriyle çakışmaması
MİMARİ KATMANLAR
- 01
İçerik çözümleme
Metni sahnelere ve karakter konuşmalarına ayırır; sonraki adımlar için tutarlı bir içerik modeli üretir.
- 02
Yapay zeka ses üretimi
Her karakterin ses kimliğini koruyarak anlatım katmanlarını dil bazında üretir.
- 03
Sahne ve ses montajı
Ortam sesini sahne bağlamından üretir, konuşma anlaşılırlığını koruyacak biçimde anlatımla birleştirir.
- 04
Katalog ve yetkilendirme
Önizleme, abonelik ve kalıcı satın alma haklarını oynatma altyapısından bağımsız değerlendirir.
Ölçülebilir sonuçlar
SİSTEM ÇIKTILARI
- Tek üretim hattı
Tekrarlanabilir sesli kitap üretimi
Karakter tespiti, ses ataması ve sahne montajı ayrı operasyonlar yerine izlenebilir tek akışta birleşti.
- Dil başına ayrı katman
Çok dilli anlatım
Yeni bir dil, kaynak kitabı yeniden kurmadan kendi sesleriyle üretilebilen bağımsız bir anlatım katmanına dönüştü.
- Üç erişim modeli
Tek yetkilendirme sistemi
Ücretsiz önizleme, abonelik ve kalıcı satın alma aynı katalogda birbirinden ayrıştırıldı.
Öne çıkanlar
Karakter başına ayrı yapay zeka sesiyle çok sesli, sinematik anlatım
Bölümün içeriğine göre üretilen sahne bazlı ortam sesi
Aynı kitabın her dilde o dilin kendi sesleriyle sunulması
Türden bağımsız, her kitap kategorisine açık katalog
Ücretsiz önizleme, abonelik ve kalıcı satın almadan oluşan üç katmanlı erişim
Kullanılan teknolojiler
- Karakter tespiti ve ses atamasını birleştiren özel üretim hattı
- Sahne içeriğine duyarlı otomatik ortam sesi üretimi
- Dilden bağımsız içerik ve anlatım mimarisi
- Abonelik ile kalıcı satın almayı aynı anda taşıyan yetkilendirme sistemi
Sıkça sorulan sorular
Her karakterin ayrı sesle okunması pratikte nasıl çalışıyor?
Metin önce karakterlerine ayrılıyor. Hangi replik kime ait, tespit ediliyor; her karaktere kendi yapay zeka sesi atanıyor; sahne montajı bu atamaya göre yapılıyor. Üçü tek bir üretim hattının parçası, çünkü bir karakterin sesi bölüm ortasında değişirse dinleyicinin kurduğu sahne dağılır. Ortaya replikleri birbirinden ayrılabilen çok sesli bir anlatım çıkıyor.
Ortam sesleri hazır bir ses kütüphanesinden mi seçiliyor?
Hayır, sahnenin içeriğine göre üretiliyor. Bölümde fırtına varsa fırtına, tren varsa tren, kalabalık bir cadde varsa şehir gürültüsü anlatımın altına biniyor. Dinleyicinin sahneyi film gibi duyması için var, o yüzden anlatımın önüne geçmeyecek biçimde katmanlanıyor.
Aynı kitap birden fazla dilde nasıl sunuluyor?
İçerik, karakter sesleri ve ortam sesleri dilden bağımsız bir yapıda duruyor. Her dil için ayrı bir anlatım katmanı üretiliyor, yani dil eklemek kitabı baştan kurmak anlamına gelmiyor. Her dilde anlatım o dilin kendi yapay zeka sesleriyle yapılıyor; tek bir kaydın üzerine altyazı geçilmiyor.
Katalog belirli bir kitap türüyle sınırlı mı?
Sınırlı değil. Üretim hattı türden bağımsız kuruldu, farklı kategorilerdeki kitaplar aynı hattan geçiyor. Bu bilinçli bir karardı: platformu tek bir türe bağlamak, o tür tükendiğinde altyapıyı yeniden yazmak demekti.
Erişim modeli nasıl kurgulandı?
Üç katmanlı. Her kitapta ücretsiz bir önizleme, sınırsız dinleme için abonelik, bir de tek seferlik satın alma. Sonuncusunda erişim kalıcı: abonelik iptal edilse bile kitap kullanıcıda kalıyor. Üçü çakışmasın diye yetkilendirme oynatma katmanından ayrıldı. «Bu kişi bunu dinleyebilir mi» sorusu, «bu ses nasıl çalınır» sorusundan bağımsız cevaplanıyor.
Audvia benzeri bir içerik ürünü mü planlıyorsunuz?
Yapay zeka üretim hattı, çok dilli katalog ve erişim modeli gerektiren ürününüzün teknik kapsamını birlikte çıkaralım.
Projenizi konuşalım