2026 yılında yapay zeka kişi arama teknolojisi ne kadar başarılı? Bunu öğrenmek için açık kaynaklı bir kıyaslama testi hazırladık. İşe alım, satış ve araştırma alanlarındaki gerçek iş akışlarından derlenen 119 gerçek sorguyu dört platformda test ettik: Lessie, Exa, Claude Code ve Juicebox. Her sonuç, canlı web kaynaklarına göre bağımsız olarak doğrulandı. Beyan edilen veriler veya özenle seçilmiş örnekler kullanılmadı.
Sonuç: Lessie, genel değerlendirmede 65,2 puan alarak dört senaryo kategorisinin tamamında lider oldu. En yakın rakip platform ise 55 puanda kaldı. Bu yazıda, ölçüm kriterlerimizden puanlama yöntemimize ve verilerin yapay zeka destekli kişi arama dünyası hakkında neler fısıldadığına kadar tüm test sonuçlarını detaylandırıyoruz.
Bu Test Neden Önemli?
Yapay zeka kişi arama çözümleri; işe alım, satış ve araştırma ekipleri için temel bir altyapı haline geliyor. Ancak şimdiye kadar platformları karşılaştırmak için standart bir yöntem yoktu. Sağlayıcılar, doğrulanması mümkün olmayan doğruluk oranları beyan ediyor, vaka çalışmaları ise sadece en iyi sonuçları cımbızlıyordu. Bu kıyaslama testi durumu değiştiriyor — 119 gerçek sorgu, bağımsız web doğrulaması ve test edilen her platform için adil bir oyun alanı.
Platform Karşılaştırması
0–100 ölçeğinde web doğrulamasıyla bağımsız olarak puanlanan 119 gerçek sorgu. Her platform aynı sorguları birebir aynı koşullar altında çalıştırdı. Puanlar üç boyutta ortalandı: Alaka Düzeyi, Kapsam ve Kullanışlılık.

Genel puanlar: Lessie 65,2 | Exa 55 | Claude Code 46 | Juicebox 45,8. Genel puan; her biri 0–100 ölçeğinde bağımsız olarak ölçülen Alaka Düzeyi, Kapsam ve Kullanışlılık boyutlarının aritmetik ortalamasıdır.
Boyutlara göre incelediğimizde: Lessie; Alaka Düzeyi (en yakın rakibin 54,3 puanına karşılık 70,2), Kapsam (58,1’e karşılık 69,1) ve Kullanışlılık (53,1’e karşılık 56,4) alanlarında liderliği elinde tuttu. En büyük fark Alaka Düzeyinde görüldü — ikinci sıradaki rakibe karşı %+29 avantaj sağlayan Lessie, farklı sorgu türlerinde doğru kişileri tutarlı ve doğru bir sıralamayla listelemeyi başardı.
Senaryoya Göre Performans
Kıyaslama testi, yapay zeka kişi arama teknolojisinin iş değeri yarattığı dört gerçek kullanım senaryosunu kapsıyor. Her senaryo farklı bir iş akışını yansıtıyor: farklı veri kaynakları, farklı kriter karmaşıklığı ve “iyi” bir sonucun farklı tanımları.

Influencer / KOL: Lessie 62,3 | Claude Code 43,2 | Exa 41,6 | Juicebox 31,1. Bu, tüm testteki en geniş performans farkı oldu. Tek kaynaklı platformlar burada ciddi zorluk yaşıyor çünkü influencer’lar Instagram, TikTok, YouTube, Twitter, podcast’ler ve bültenler gibi dağınık sosyal platformlarda varlık gösteriyor ve hiçbir tekil veri tabanı hepsini birden kapsamıyor.
Uzman / Deterministik: Lessie 70,4 | Exa 61,2 | Claude Code 57 | Juicebox 44,2. Bu sorgular, doğrulanabilir kesin yanıtlara sahip olan veya belirli alanlardaki uzmanları hedefleyen aramalardır. Lessie’nin yapılandırılmış veri tabanlarını canlı web araştırmasıyla birleştiren hibrit arama stratejisi, tam olarak doğru kişileri bulmada en etkili yöntem olduğunu kanıtladı.
B2B Müşteri Bulma (Prospecting): Lessie 60,6 | Exa 55,2 | Juicebox 51,4 | Claude Code 43. Hedef şirketlerdeki karar vericileri bulmak, en yaygın yapay zeka kişi arama kullanım senaryosudur. Lessie’nin avantajı, mevcut görevleri ve iletişim bilgilerini doğrulamak için birden fazla veri kaynağını çapraz sorgulamadan geçirmesinden kaynaklanıyor.
İşe Alım (Recruiting): Lessie 68,2 | Juicebox 65,7 | Exa 64,7 | Claude Code 50,5. Bu, rekabetin en yüksek olduğu senaryoydu — üç platform genel olarak 64 puanın üzerinde başarı gösterdi. İşe alım sorguları, tüm platformların erişebildiği LinkedIn odaklı veri tabanlarından besleniyor. Bu kategorideki farklar testin en dar marjlarını oluşturuyor.
Senaryo Detayları
Her senaryo puanı üç bağımsız boyuta ayrılıyor: Alaka Düzeyi (doğru kişileri buldunuz mu?), Kapsam (kaç nitelikli sonuç elde edildi?) ve Kullanışlılık (dönen veriler harekete geçmeye uygun mu?). İşte detaylı döküm.
Influencer / KOL — Sosyal platformlarda içerik üreticilerini bulma
- Lessie: Alaka Düzeyi 65,2, Kapsam 62,8, Kullanışlılık 58,9 — %100 tamamlanma oranı
- Exa: Lessie performansının %89,7’si
- Claude Code: Lessie performansının %82,8’i
- Juicebox: Lessie performansının %79,3’ü
Uzman / Deterministik — Doğrulanabilir yanıtları olan sorgular veya belirli alan uzmanları
- Lessie: Alaka Düzeyi 79, Kapsam 75,2, Kullanışlılık 57,1 — %100 tamamlanma oranı
- Exa: Lessie performansının %96,4’ü
- Claude Code: %100 tamamlanma oranı ancak daha düşük genel puanlar
- Juicebox: Lessie performansının %71,4’ü
B2B Müşteri Bulma — Hedef şirketlerdeki karar vericileri bulma
- Lessie: Alaka Düzeyi 62,8, Kapsam 63,5, Kullanışlılık 55,5 — %100 tamamlanma oranı
- Exa: %100 tamamlanma oranı, Kapsam boyutunda yakın sonuç
- Juicebox: Lessie performansının %84,4’ü
- Claude Code: %75 tamamlanma oranı — bu kategorideki en düşük oran
İşe Alım — Belirli becerilere, deneyime ve konuma sahip adayları bulma
- Lessie: Alaka Düzeyi 74,8, Kapsam 75,6, Kullanışlılık 54,3 — %100 tamamlanma oranı
- Exa, Juicebox: her ikisi de %100 tamamlanma oranı
- Claude Code: %90 tamamlanma oranı
- İşe alım, tüm platformlarda en yüksek mutlak puanları aldı — bu, yapay zeka kişi arama teknolojisinin en olgunlaşmış kullanım senaryosudur
Değerlendirme Veri Seti
Kıyaslama testinde; işe alım, satış ve araştırma alanlarındaki gerçek uzman iş akışlarından derlenen 119 sorgu kullanılmıştır. Bunlar yapay test senaryoları değildir; profesyonellerin insan ararken gerçekleştirdiği gerçek aramaları yansıtır. Veri seti çok dillidir (İngilizce, Portekizce, İspanyolca, Felemenkçe) ve doğrudan saha deneyimine dayanır.
- İşe Alım (30 sorgu): Belirli becerilere, deneyim seviyelerine ve konumlara sahip adayları bulma
- B2B Müşteri Bulma (32 sorgu): Satış iletişimi için hedef şirketlerdeki karar vericileri belirleme
- Uzman / Deterministik (28 sorgu): Doğrulanabilir kesin yanıtları olan veya belirli alan uzmanlarını arayan sorgular
- Influencer / KOL (29 sorgu): Niş, kitle ve etkileşime göre sosyal platformlarda içerik üreticilerini bulma
Üç değerlendirme boyutu, arama kalitesinin bağımsız yönlerini ölçer: Alaka Düzeyi (sıralama kalitesi), Kapsam (sonuç hacmi) ve Kullanışlılık (veri eksiksizliği). Bunlar birleşerek Genel puanı oluşturur.
Metodoloji
Değerlendirme süreci tamamen otomatik ve tekrarlanabilirdir. Her platformdan elde edilen her sonuç, canlı web kaynaklarına göre doğrulanır — beyan edilen veriler veya manuel düzenlemeler kullanılmaz.
1. Adım: Sorguyu Ayrıştırma. Örneğin “Berlin’de Series B bir girişimde Kıdemli ML mühendisi” gibi bir sorgu; rol, kıdem, alan, şirket aşaması ve konum gibi yapılandırılmış bir kontrol listesine dönüştürülür. Bu ayrıştırma, her bir sonuç için derecelendirme kriterlerini belirler.
2. Adım: Web Üzerinden Doğrulama. Her platformun döndürdüğü her kişi; LinkedIn, şirket web siteleri ve sosyal profiller üzerinden kontrol edilir. Beyan edilen veriler değil, yalnızca çevrim içi ortamda bağımsız olarak doğrulanabilen bilgiler esas alınır. Bu, platform yanlılığını ortadan kaldırır ve adil bir karşılaştırma sağlar.
3. Adım: Üç Eksende Puanlama. Alaka Düzeyi (doğru kişileri buldunuz mu?), Kapsam (kaç kişi?) ve Kullanışlılık (profil verileri gerçekten işe yarıyor mu?). Bu üç puan birleşerek tek bir Genel puan oluşturur: (Alaka Düzeyi + Kapsam + Kullanışlılık) / 3.
Neleri Ölçüyoruz?
Alaka Düzeyi — Padded nDCG@10. Döndürülen kişilerin sorguyla eşleşip eşleşmediğini ve doğru şekilde sıralanıp sıralanmadığını ölçer. Her kişi web üzerinden doğrulanır ve açık kriterlere göre derecelendirilir. Puan 10 yuvaya tamamlanır (daha az sonuç döndürmek cezalandırılır). Bu, en iyi sonuçlarda hem hassasiyeti (precision) hem de geri çağırmayı (recall) ödüllendirir.
Kapsam — TCR × Yield. Sorgu başına kaç nitelikli kişinin bulunduğunu ölçer. Görev tamamlanma oranını (platform herhangi bir sonuç döndürdü mü?) K=10 ile sınırlı ortalama nitelikli sonuç verimiyle birleştirir. Bu, hem güvenilirliği hem de ilgili sonuçların hacmini ödüllendirir.
Kullanışlılık — (C + E + A) / 3. Döndürülen verilerin eksiksiz ve harekete geçmeye uygun olup olmadığını ölçer. Üç alt boyutun ortalamasını alır: yapısal eksiksizlik (C), sorguya özel kanıtlar (E) ve eyleme geçirilebilirlik (A). İsim içeren ancak e-posta, unvan veya şirket bilgisi olmayan bir profil, kişi ilgili olsa bile Kullanışlılık boyutunda düşük puan alır.
Öne Çıkan Bulgular
119 sorguda gerçekleştirilen 476 platform çalışmasının ardından, yapay zeka kişi arama teknolojisinin bugün nerede durduğunu ve her platformun nerede öne çıkıp nerede yetersiz kaldığını gösteren çeşitli kalıplar ortaya çıktı.
- Dört Senaryonun Tamamında 1 Numara. Lessie; İşe Alım, B2B Müşteri Bulma, Uzman / Deterministik ve Influencer / KOL olmak üzere her kategoride lider olan tek platformdur. Başka hiçbir platform birden fazla senaryoda birinci olamadı.
- %100 Tamamlanma Oranı. Her sorgu sonuç döndürdü. Başka hiçbir platform bunu başaramadı — özellikle diğerlerinin boş döndüğü niş ve soyut aramalarda bile. Sıfır sonuç döndürmek, tek kaynaklı platformlara özgü bir başarısızlık modudur.
- En Büyük Alaka Düzeyi Farkı: 54,3’e karşı 70,2 (%+29). Sıralama kalitesi farkı, en çok çok kriterli sorgularda (rol, kıdem, sektör ve konum kısıtlamalarını birleştiren aramalar) belirginleşti.
- En Geniş Fark Influencer Aramalarında. Lessie genel olarak 62,3 puan alırken ikinci sıradaki rakip 43,2 puanda kaldı. Tek kaynaklı platformlar burada en çok zorluğu yaşıyor çünkü influencer verileri düzinelerce sosyal platforma dağılmış durumda.
- En Yakın Yarış Kullanışlılık Boyutunda. Profil verilerinin eksiksizliği en rekabetçi boyut oldu; tüm platformlar 42,7 ile 56,4 arasında puan aldı. Sektörün gelişim için en çok alana sahip olduğu yer burası.
- İşe Alım En Rekabetçi Alan. Üç platform genel olarak 64 puanın üzerinde başarı gösterdi. Bu, mevcut araçların en iyi performans gösterdiği ve farkların en az olduğu senaryodur. LinkedIn odaklı veriler, tüm platformlara burada daha güçlü bir temel sağlıyor.
Açık Kaynak: Değerlendirme veri setinin tamamı, puanlama metodolojisi ve platform düzeyindeki sonuçlar incelemeye açıktır. Şeffaf kıyaslama testlerinin tüm sektörü ileriye taşıdığına inanıyoruz.