2026 yılında, yapay zeka dünyasındaki en ilginç cümle yeni bir model hakkında değil. Bu, Anthropic, Martin Fowler ve yapay zeka araştırma topluluğunun son birkaç haftadır üzerinde birleştiği bir formül:
Agent = Model + Harness.
Son zamanlarda yapay zeka Twitter'ındaysanız, her yerde harness kelimesini görmüşsünüzdür. Princeton, HAL harness'ını yayınladı. HKUDS, OpenHarness'ı açık kaynak haline getirdi. Yeni bir Meta-Harness makalesi, sabit bir modelin etrafındaki harness'ı otomatik olarak yeniden yazmanın, ağırlıklara dokunmadan TerminalBench-2 skorlarını birkaç puan artırabileceğini gösterdi. Philipp Schmid, uzun süren görevlerde model sapmasını çözmek için en birincil aracın bir harness ajanı olduğunu belirtti.
Ancak kimsenin yüksek sesle söylemediği bir şey var: 2026'daki neredeyse tüm harness tartışmalarıkodlama ajanları hakkında. Claude Code. SWE-bench. Terminal görevleri. Depo (repo) navigasyonu.
Peki ya geri kalan her şey? Git deposu içermeyen yapay zeka ajanı görevleri ne olacak?
Biz Lessie'yiz ve tek bir iş için özel bir harness ajanı geliştiriyoruz:kişi arama. İşe alım uzmanları bizi aday bulmak için kullanıyor. Satış ekipleri karar vericileri, yatırımcılar kurucuları, pazarlamacılar ise içerik üreticilerini bulmak için bize güveniyor. Harness tartışmaları alevlendiğinde, somut bir şeyi merak ettik: “Harness modelden daha önemlidir” tezi kodlama dışındaki alanlarda da geçerli mi?
Bu yüzden bir benchmark oluşturduk ve deneyi gerçekleştirdik. Sonuç:PeopleSearchBench. İşte öne çıkan ana veri:
119 gerçek dünya kişi arama sorgusunda, Lessie 65.2 puan aldı. Sonnet 4.6 üzerinde çalışan Claude Code ise 45.8 puanda kaldı. Bu, %42'lik devasa bir fark demektir — ve değişen tek şey harness katmanıydı.
Şimdi bunun ne anlama geldiğini detaylandıralım.
Sade bir dille açıklamak gerekirse: Harness ajanı nedir?
En kısa tanım OpenHarness ekibinden geliyor: Model ajandır; kod ise harness'tır. Parallel Web'den biraz daha uzun bir tanım: Harness, bir modeli saran, araç çağrılarını yakalayan, bağlamı yöneten ve modeli görevde tutan çalışma zamanıdır (runtime).
Martin Fowler bunu birlikte çalışan iki yarı olarak çerçeveliyor. Kılavuzlar (Guides)ileri beslemeli kontrollerdir — ajanın hareket etmeden önceki davranışını şekillendirirler (sistem yönlendirmeleri, araç açıklamaları, getirilen bağlam, ortam anlık görüntüleri). Sensörler (Sensors)ise geri beslemeli kontrollerdir — ajanın ne yaptığını gözlemler ve düzeltmeleri geri beslerler (linter'lar, doğrulayıcılar, doğrulama döngüleri). İyi bir harness ajanı her ikisini de birleştirir. Kötü bir harness ise yalnızca ileri beslemelidir ve ajanın 47. adımda aynı hatayı tekrarlamasını izler.
Yani bir harness ajanı, paketin tamamıdır: Ham token tahminini gerçek bir işi tamamlayabilecek bir güce dönüştüren model, kılavuzlar, sensörler, araçlar, bellek ve doğrulama mantığının birleşimi.
Ortaya çıkan iki farklı yaklaşım var:
- Genel amaçlı harness yapıları: Claude Agent SDK, OpenHarness ve Claude Code içindeki harness gibi çözümler. Bunlar alandan bağımsız olacak şekilde tasarlanmıştır.
- Dikey harness yapıları: Belirli bir iş etrafında inşa edilen, o işin hata modlarına göre ayarlanmış kılavuzlar ve sensörler içeren çözümler.
Okuduğunuz neredeyse tüm harness benchmark'ları — SWE-bench, TerminalBench-2, USACO, AppWorld — kodlama görevlerindeki genel harness yapılarını ölçer. Bildiğimiz kadarıyla PeopleSearchBench, kodlama dışı bir görevde dikey bir harness ajanı ile genel bir ajanı karşı karşıya getiren ilk benchmark'tır.
Kişi arama neden kendi özel harness yapısına ihtiyaç duyar?
Eğer genel bir yapay zeka ajanından “Berlin'deki B Serisi girişimlerde çalışan ve LLM ürünleri geliştirmiş kıdemli ML mühendislerini bulmasını” istediyseniz, hata modlarını zaten biliyorsunuzdur. Bunlardan üçü özellikle inatçıdır ve üçü de model değil, doğrudan harness sorunudur:
1. Kaynaklar arası kimlik çözümleme (Entity Resolution). Gerçek bir kişi LinkedIn, X, GitHub, konferans konuşmaları, şirket sayfaları ve akademik veri tabanlarında aynı anda var olur. Farklı isimler, farklı fotoğraflar, bazen farklı yazımlar kullanırlar. Genel bir harness yapısının “bu LinkedIn profili ile bu GitHub hesabı aynı kişiye ait” şeklinde yerleşik bir algısı yoktur. Bir kişi arama harness ajanı, her sorguda bunu çözmek zorundadır.
2. Doğrulama döngüleri. Bir sensör katmanı olmadığında, yapay zeka ajanları kendinden emin bir şekilde hayali kişiler uydurur. Sırf token'lar kulağa mantıklı geldiği için gerçekte var olmayan bir “Stripe Berlin Kıdemli ML Mühendisi” uydurabilirler. Çözüm daha akıllı bir model değildir — Sonnet 4.6 bile Claude Code içinde bunu yapmaya devam ediyor. Çözüm bir sensör kullanmaktır: Döndürülen her kişi, kullanıcıya ulaşmadan önce canlı web kaynaklarıyla doğrulanır.
3. İnsani nitelikler için sorgu ayrıştırma. “B Serisi Berlin ML mühendisi” tek bir sorgu değildir. Bu bir kontrol listesidir: rol + kıdem + şirket aşaması + konum + uzmanlık alanı + son çıktılar. Genel bir harness, tüm bu cümleyi tek bir arama kutusuna atar. Dikey bir harness ise bunu kriterlere ayırır, doğru kaynaklarda paralel olarak çalıştırır, ardından yeniden birleştirip sıralar.
Bunların her biri, Fowler'ın kılavuzlar ve sensörler ile kastettiği şeydir. Sadece genel bir kodlama harness'ının ihtiyaç duymadığı, bu yüzden kimsenin entegre etmeye uğraşmadığı kılavuzlar ve sensörlerdir.
Kanıtlar: PeopleSearchBench
Bunu dürüstçe test etmek için PeopleSearchBench'i kurduk. Metodolojinin tamamı makalede yer alıyor, ancak özet geçmek gerekirse:
- Gerçek işe alım, satış ve araştırma iş akışlarından elde edilen 119 gerçek sorgu
- 4 dil (İngilizce, Portekizce, İspanyolca, Felemenkçe)
- 4 senaryo: İşe Alım (30), B2B Potansiyel Müşteri Bulma (32), Uzman / Deterministik (28), Influencer / KOL (29)
- Test edilen 4 platform: Lessie (dikey harness ajanı), Exa (yapılandırılmış arama API'si), Juicebox / PeopleGPT (800 milyondan fazla profile sahip işe alım platformu), Claude Code (Sonnet 4.6 üzerinde çalışan genel harness)
- Üç bağımsız boyut: Alaka Düzeyi (padded nDCG@10), Kapsam (görev tamamlama × verim), Fayda (profil verisi eksiksizliği)
- Yapay zeka tahminleriyle değil, canlı web aramasıyla doğrulama — döndürülen her kişi LinkedIn, şirket siteleri ve kamuya açık profiller üzerinden kontrol edilir. Doğrulama ajanı, hangi sonucun hangi platformdan geldiğini bilmez.
İşte genel skorlar:
- Lessie: Genel 65.2 | Alaka Düzeyi 70.2 | Kapsam 69.1 | Fayda 56.4
- Exa: Genel 54.6 | Alaka Düzeyi 53.8 | Kapsam 58.1 | Fayda 53.1
- Claude Code: Genel 45.8 | Alaka Düzeyi 54.3 | Kapsam 41.1 | Fayda 42.7
- Juicebox: Genel 45.8 | Alaka Düzeyi 44.7 | Kapsam 41.8 | Fayda 50.9
Lessie her boyutta birinci sırada yer alıyor. Ayrıca 119 sorgunun tamamını başarıyla tamamlayan tek platform oldu — %100 tamamlama oranı. Diğer üç platform niş aramalarda genellikle sonuç döndüremedi.
Ancak harness tartışması için en önemli rakam, Lessie ile Claude Code arasındaki farktır. Her ikisi de yapay zeka ajanıdır. Her ikisi de araçları çağırabilir. Her ikisi de web'de arama yapabilir. Claude Code, gezegendeki en güçlü modellerden biriyle çalışıyor. Buna rağmen genel skorda 19.4 puanve Kapsam boyutunda 28 puanlık bir farkla geride kaldı.
Bu 19.4 puanlık fark bir model farkı değildir. Bu doğrudan bir harness farkıdır.
En geniş tek senaryolu fark, Lessie'nin 62.3 ve Claude Code'un 43.2 puan aldığı Influencer / KOL keşfi senaryosunda görüldü. Influencer araması, genel harness yapılarının en çok zorlandığı yerdir; çünkü doğru yanıt aynı anda TikTok, Instagram, YouTube ve X üzerinde yaşar ve genel bir harness bunları nasıl birleştireceğini bilemez. En dar fark ise üç platformun da 64'ün üzerinde puan aldığı İşe Alım senaryosuydu — işe alım, en olgun kişi arama dikeyidir ve sektör bu araçları geliştirmek için yıllara sahipti.
Kalıp tutarlıdır: Bir senaryo ne kadar çok çoklu kaynak birleştirmesi ve doğrulama gerektiriyorsa, harness o kadar kritik hale gelir.
Lessie harness katmanının içinde ne var?
Sistem yönlendirmelerimizi (system prompts) paylaşmayacağız. Ancak mimari, kılavuzlar ve sensörler modeline tam olarak uyan üç katmandan oluşuyor ve dikey bir harness ajanı için bunların ne anlama geldiğini açıklamakta fayda var:
1. Katman — Çoklu kaynak orkestrasyonu (kılavuzlar). Bir sorgu geldiğinde, harness bunu profesyonel ağlar, sosyal platformlar, akademik veri tabanları ve kamu sicilleri arasında paralel olarak yönlendirir. Her kaynağın kendi erişim stratejisi vardır. Model ham dağılımı asla görmez; birleştirilmiş bir aday seti görür.
2. Katman — Kriter ayrıştırma ve doğrulama (sensörler). Her sorgu; rol, kıdem, konum, şirket aşaması ve sinyaller gibi açık kriterlere bölünür. Her aday, sıralama adımından önce canlı web aramalarıyla bu kriterlere göre doğrulanır. Bu, PeopleSearchBench'in bizi puanlamak için kullandığı metodolojinin aynısıdır ve bu bir tesadüf değildir: Harness yapımızı, benchmark'ın ölçtüğü hata modlarına göre inşa ettik.
3. Katman — Profil zenginleştirme. Bir kişi doğrulamayı geçtikten sonra, harness mevcut rol, son etkinlikler, iletişim yolları ve sosyal medya varlığı gibi yapılandırılmış profil verilerini çeker. Fayda skorumuzun sektöre liderlik etmesinin nedeni budur: Doğru kişiyi boş alanlarla döndürmek yararlı değildir ve genel bir harness'ın yerleşik bir adım olarak zenginleştirme yapması için hiçbir nedeni yoktur.
Ortadaki model, modellerin iyi olduğu işi yapıyor: akıl yürütme, sıralama, özetleme ve yargılama. Harness ise geri kalan her şeyi üstleniyor. Harness'ı çıkarırsanız elinizde bir sohbet robotu kalır. Modeli çıkarırsanız bir arama hattınız olur. İkisini bir araya getirdiğinizde ise dikey bir harness ajanı elde edersiniz.
Bu durum harness tartışması için ne anlama geliyor?
2026 harness tartışmalarından çıkan ilginç iddia, statik benchmark'larda model gelişiminin yavaşladığı, ama ajansal performansın hala sonuna kadar açık olduğudur; çünkü kalan kazanımların çoğu harness katmanında gizlidir. Meta-Harness, kodlama için daha iyi harness yapılarını otomatik olarak keşfederek bunu gösterdi. PeopleSearchBench de aynı şeyi diğer yönden kanıtlıyor: Özel olarak oluşturulmuş dikey harness yapıları, genel bir harness içinde çalışan öncü bir modeli, hiçbir model güncellemesinin kapatamayacağı farklarla geride bırakabilir.
Eğer bu doğruysa, iki sonuç ortaya çıkar.
Birincisi, ticari değeri olan her iş kolu kendi özel harness ajanı çözümüne kavuşacaktır.Kişi arama bunlardan biridir. Hukuki araştırma, klinik akıl yürütme, finansal analiz, tedarik zinciri incelemesi, bilimsel literatür taraması... Bunların her biri, genel bir harness'ın asla optimize edemeyeceği hata modlarına sahiptir; çünkü genel harness her şeyi optimize etmeye çalışır. Dikey harness ajanları, SaaS'ın yazılım dünyasını domine ettiği gibi yapay zeka ajanı dünyasını domine edecektir.
İkincisi, benchmark'ların da bunu takip etmesi gerekir. SWE-bench ve TerminalBench-2 harika araçlardır ancak harness kalitesinin yalnızca tek bir yönünü ölçerler. Sektör harness tezi konusunda ciddiyse, önemli olan her dikey alan için harness benchmark'larına ihtiyacımız var. PeopleSearchBench, kişi arama için bunu başlatma girişimimizdir. Veri seti, değerlendirme hattı ve tüm sonuçlar açık kaynaklıdır.
Model motordur. Harness ise arabadır. Biz arabayı tek bir yol için inşa ettik. Eğer işiniz adaylar, müşteriler, yatırımcılar, içerik üreticileri veya ortaklar gibi kişileri bulmayı içeriyorsa, bu arabayı deneyin: lessie.ai. Ve öncü model kullanan bir kodlama ajanını, hiç üretilmediği bir alanda tam olarak nasıl yendiğimizi görmek isterseniz, tüm benchmark ve makale burada yer alıyor.
2026'da harness en büyük rekabet avantajıdır. Rakamlar bunu açıkça gösteriyor.