LenserFight: AI ajanlarını ve istemlerini değerlendirmek için yerel öncelikli platform
LenserFight, Conectlens tarafından, AI ajanları, yeniden kullanılabilir istemler ve değerlendirme iş akışları tasarlamak ve benchmark yapmak için açık bir platformdur. Takımların versiyonlu "Lensler" oluşturmasına, yönlendirilmiş döngüsel olmayan grafik iş akışlarını çalıştırmasına ve rubrik puanlaması ile insan yargısını birleştiren değerlendirme etkinliklerini sahnelemesine olanak tanıyan bir AI laboratuvarı olarak hizmet eder. Araç, bir Model Bağlam Protokolü (MCP) sunucusu, yerel model yürütme seçenekleri ve paylaşılan günlükler için bir kamu arenası içerir. Hedef kullanıcılar, yeniden üretilebilir değerlendirme ve özel benchmark üzerinde yoğunlaşan AI geliştiricileri, istem mühendisleri ve araştırmacılardır.
Platforma hangi görevleri belirtmenize ve yeniden üretmenize izin veriyor?
Platform, bir görevi resmi bir "Lens" olarak ele alır; bu, bir istem, değerlendirme ölçütü ve yapılandırılmış çıktılar için isteğe bağlı bir şemayı birleştiren sürümlü bir spesifikasyondur. Lens'ler, ekiplerin modeller arasında aynı talimatları çalıştırabilmesi ve denetim için sürümleri koruyabilmesi için yeniden kullanılabilir test vakaları olarak işlev görür. Bu tasarım, model çalışmaları arasında sonuçları karşılaştırırken veya deneyleri çoğaltırken yardımcı olan, ad-hoc istemler yerine yapılandırılmış değerlendirme belgelerini destekler.
Değerlendirme puanları nasıl üretilir ve karşılaştırılır?
Değerlendirme olayları, otomatik ölçüt puanlamasını topluluk odaklı insan oylarıyla birleştiren çift puanlama modeli kullanır ve kamuya açık liderlik tabloları ve ELO tarzı sıralamalar üretir. Bu kombinasyon, nesnel ölçüt metriklerini niteliksel insan yargılarıyla dengelemeyi amaçlar. Güvenilirlik, ölçüt tasarımına ve insan seçmenlerin örneklemesine bağlıdır, bu nedenle karşılaştırmalar yalnızca Lens'lerin ve her çalışmayı takip eden kayıtlı yürütme günlüklerinin yeniden üretilebilirliği kadar güvenilirdir.
Hangi girişler ve yürütme ortamları destekleniyor?
MCP sunucusu, Model Context Protocol istemcileriyle entegrasyon için otuzdan fazla aracı açığa çıkarır ve platform, Ollama, vLLM ve llama.cpp aracılığıyla yerel model orkestrasyonunu destekler. Web tabanlı istemciler, OAuth 2.1 PKCE aracılığıyla entegre olur. Bu seçenekler, ekiplerin hem bulut bağlantılı hem de çevrimdışı deneyler gerçekleştirmesine olanak tanır ve tek bir MCP uç noktası aracılığıyla yerel ve uzaktan asistanların yan yana karşılaştırmasını sağlar.
Platform, gizliliğe duyarlı bir iş akışına nasıl uyuyor?
Proje, veri gizliliği ve karşılaştırma için çevrimdışı model çalıştırmalarını mümkün kılarak yerel öncelikli bir duruş benimserken, aynı zamanda paylaşılan günlükler ve yürüyüşler için kamuya açık bir topluluk alanı sunar. Kod tabanı GitHub'da açık kaynaklıdır ve proje deneysel bir beta aşamasındadır, bu nedenle kuruluşların, resmi değerlendirmeler için güvenmeden önce aktif geliştirme, topluluk moderasyonu ve teknik bir kurulum aşaması planlaması gerekir.
Platforma, yeniden üretilebilir, yerel olarak kontrol edilen model karşılaştırmaları arayan teknik olarak yetkin ekipler için uygundur
Platform, sürümlü test nesneleri ve yerel yürütme kontrolü elde etmek için yapılandırma yükünü kabul eden AI geliştiricileri ve araştırmacılar için pratik bir seçenektir. Deneysel beta durumu ve topluluk odaklı değerlendirme modeli, sonuçların güvenilir olması için dikkatli bir rubrik tasarımı ve moderasyon gerektirdiği anlamına gelir. Yeniden üretilebilir kıyaslama ve yerel model çalıştırmalarını önceliklendiren ekipler için platform, net bir değerlendirme çerçevesi sunar; teknik olmayan kullanıcılar için ise kurulum karmaşıklığı, anlık faydayı sınırlayabilir.