Sherbim

AI + ML

Integrojme AI ne softuer biznesi — RAG (retrieval-augmented generation) mbi te dhenat tuaja, agjente AI qe ndermarrin veprime reale, ekstraktim structured-output nga PDF / forma / email, pipeline klasifikimi + scoring. Rastet tona te brendshme te perdorimit perfshijne asistentin AI te kontabilitetit Merot Finance, scoring leads ne Merot Leads dhe OCR faturash.

Rezultate konkrete

  • RAG mbi knowledge base-in tuaj — dokumente te brendshme / Notion / Confluence / Slack archives → asistent AI i kerkueshem.
  • Ekstraktim i strukturuar nga dokumente — fatura, kontrata, formulare, raporte shpenzimesh. Output JSON qe mund ta ruani ne DB-ne tuaj.
  • Agjente AI qe ndermarrin veprime — rezervojne takime, hartojne email, ekzekutojne queries database, postojne ne Slack.
  • Klasifikim + scoring — scoring leads, detektim mashtrimi, sentiment, moderim permbajtjeje.
  • Embeddings + kerkim — kerkim semantik mbi katalogun tuaj te produktit, tikete mbeshtetjeje, repon e kodit.
  • On-premises model serving — kur privacy i te dhenave do te thote qe API cloud jane off-limits. Llama 3, Mixtral, modele me te vegjel fine-tuned.

Me cfare punojme

Zgjedhim cfare i pershtatet ekipit tuaj. Nuk imponojme preferencat tona.

API providers

OpenAI · Anthropic Claude · Google Gemini · Mistral AI · Cohere

Frameworks

LangChain (sometimes) · LlamaIndex · Vercel AI SDK · Anthropic SDK · OpenAI SDK

Vector databases

pgvector (Postgres) · Pinecone · Qdrant · Weaviate · Chroma

Self-hosted models

Llama 3 (8B-70B) · Mistral 7B / Mixtral 8x7B · Whisper (speech-to-text) · Stable Diffusion (image)

Inference infra

AWS Bedrock · Replicate · Together AI · self-hosted via vLLM / TGI

Eval + observability

LangSmith · Helicone · OpenAI usage dashboards · custom eval harnesses

Si punojme

01

Zbulim (1 jave)

Percakto qarte rastin e perdorimit: cfare input → cfare output. Shkruajme evals qe ne fillim qe te dijme cfare do te thote 'punon'.

02

Prototip (1-2 jave)

Thirrja me e vogel e mundshme LLM qe prodhon output-in e deshiruar. Masim ne eval set. Vendosim: API apo self-hosted, cili model, cfare prompt.

03

Prodhim (3-6 jave)

Mbeshtjellim me retries, fallbacks, observability, kontrolle kostoje (buxhete tokens, rate limits). Lidhim ne produktin tuaj.

04

Iteroj

Funksionet AI kerkojne eval te vazhdueshem ndersa modelet ndryshojne. Retainer mujor ose tune-up tremujor i planifikuar.

Nga prodhimi yne

Asistent AI Merot Finance

Anthropic Claude i integruar per bank-statement matching, sugjerime journal-entry dhe rishikim month-close.

Merot Leads scoring

Claude per scoring product-fit ne enrichment + draft outreach. Prompt i personalizuar + ekstraktim structured-output.

Pipeline OCR faturash

Ekstraktim multi-stage: OCR → LLM structured output → human-review queue per artikuj me besueshmeri te ulet.

Nearshore delivery sipas tregut

Faqet e shteteve shpjegojne besimin, zonen kohore, compliance dhe pyetjet e delivery qe bleresit i bejne para zgjedhjes se partnerit software.

North Macedonia

Zhvillim softueri për kompani maqedonase: web aplikacione, aplikacione mobile, cloud sisteme, automatizim AI dhe integrime nga ekipet inxhinierike të Merot në Shkup.

Germany

Senior Balkan software teams for German companies: web, mobile, AI, cloud and integrations with EU timezone overlap, GDPR-aware delivery and DACH communication.

Austria

Nearshore web, mobile, cloud and AI engineering for Austrian SMEs and product teams. EU timezone, DACH communication, GDPR-aware delivery.

Netherlands

Senior React, mobile, backend, cloud and AI teams for Dutch SaaS and operations companies. English-first delivery, EU timezone and GDPR-aware workflows.

Switzerland

Senior Balkan software teams for Swiss companies: secure web, backend, cloud, AI and integrations with DACH communication and privacy-aware delivery.

Sweden

Nearshore web, mobile, backend, cloud and AI engineering for Swedish SaaS and operations teams. Senior delivery, EU timezone, clean handoff.

Denmark

Senior nearshore engineers for Danish product and operations teams: web, backend, mobile, cloud, AI and integrations with EU timezone overlap.

Ireland

Senior EU nearshore engineers for Irish SaaS, fintech and operations teams. Web, backend, mobile, AI and cloud delivery with English-first collaboration.

United States

Senior European software engineers for US companies: custom web apps, mobile apps, backend systems, cloud, AI workflows and integrations with practical US overlap.

Canada

Custom web, mobile, backend, cloud and AI engineering for Canadian companies. Senior European delivery, practical timezone overlap and clean handoff.

United Kingdom

Senior nearshore software engineers for UK companies: custom web apps, backend platforms, cloud modernization, AI workflows and integrations.

France

Nearshore product engineering for French companies: web apps, mobile apps, AI workflows, cloud systems and integrations with EU timezone delivery.

Belgium

Nearshore web, backend, cloud, mobile and AI engineering for Belgian companies operating across languages, regions and EU compliance expectations.

Modeli i angazhimit

Cmimi per AI varet nga kompleksiteti i workflow, cilesia e te dhenave, zgjedhja e modelit, guardrails, eval, integrimet, volumi i pritur dhe nese puna eshte prototip apo production. Caktoni scoping call; ndajme engineering effort nga model/API spend qe oferta te jete e qarte.
Cakto takim

Pyetjet me te shpeshta — AI + ML

A duhet te perdor OpenAI, Anthropic, apo self-host?

Si standard: filloni me Anthropic (Claude 3.5 Sonnet / Claude 4) ose OpenAI (GPT-4) per prototipin. Kaloni ne self-hosted vetem kur (a) residency i te dhenave e kerkon, ose (b) kostoja per thirrje tejkalon koston engineering+infra te ekzekutimit vete. Shumica e klienteve qendrojne tek ofruesit API per vite.

A do te trajnojne te dhenat e mia modelin e dikujt?

Jo ne tiers enterprise te OpenAI / Anthropic / Google — kane terma eksplicite no-training-on-customer-data. I aktivizojme keto settings gjate onboarding-ut.

Po nese AI halucinon / prodhon output te gabuar?

Dy shtresa: (1) Eval harness — masim saktesine ne nje test set te etiketuar para lansimit dhe perseri ne cdo ndryshim prompt. (2) Prodhim — output-et me besueshmeri te larte kalojne drejtperdrejt; output-et me besueshmeri te ulet shkojne ne nje human-review queue.

Kostoja — a nuk do te behet kjo e shtrenjte?

Mund te behet nese scope eshte i paqarte. E kontrollojme duke percaktuar workflow, model budgets, usage alerts dhe cfare duhet automatizuar kundrejt human-reviewed. Vleresimi varet nga use case konkret.

A beni fine-tuning?

Ndonjehere — zakonisht vetem kur qasja me prompt vertet nuk arrin atje. Fine-tuning ka kosto me te larte fillestare (kuratim te dhenash trajnimi) dhe mirembajtje re-tuning ne cdo upgrade modeli. Tipikisht rekomandojme prompts me te mira + RAG fillimisht.

Privatesi / vetem on-premises — a mund ta beni?

Po. Kemi deployed Llama 3 70B dhe Mixtral 8x22B on-premise (setups single-GPU H100 ose 4xA100) per kliente ne industri te rregulluara. Kosto fillestare me e larte, kosto per thirrje me e ulet, residency te plote te te dhenave.

Agjente AI — a jane keto reale tashme?

Me kujdes po. Agjentet single-purpose (rezervo nje takim, harto nje email, ekzekuto nje query SQL) funksionojne mire me guardrails te duhura. Agjentet gjenerike 'do anything' jane ende te paqendrueshem. Si standard scopojme tek single-purpose.

Voice / speech?

Whisper per speech-to-text, ElevenLabs / OpenAI TTS per sintetizim. Kemi ndertuar funksione call-summary + transkriptim voice-note per kliente ne vertikalet legal + healthcare.

Le ta percaktojme projektin tuaj — AI + ML

Telefonate 60-minutëshe falas. Plan i shkruar 6-faqesh brenda 48 oresh.

Kontakt

Na tregoni cfare po ndertoni.

Pergjigje gjate orarit.

Pa spam.Direkt te ekipi Merot.