Blogg

NeztoLästid: 4 min

Examensarbete (2027)

Nezto erbjuder ett examensarbete om hur bilddata som annonsbilder planritningar kan förbättra träffsäkerheten i vår AI-drivna värderingsmotor, Nezto Vision Engine™. Du får utforska hur datorseende (klassificering, segmentering, objektdetektering, embeddings) kan fånga signal som tabulär data missar, och hur den kan fusioneras in i en produktionssatt modell utan att tumma på förklarbarhet. Arbeta med verklig annonsdata, GPU-kraft och handledning från vårt ML-team och Modulais ingenjörer.

Frame 37.png

Stockholm/Göteborg

Bakgrund

Nezto bygger Nezto Vision Engine™, en toppmodern AVM (automated valuation model) som kombinerar tabulär data, datorseende och förklarbar maskininlärning för att värdera bostäder i stor skala. Vi erbjuder ett examensarbete om hur bilddata kan användas för att ytterligare förbättra träffsäkerheten i vår värderingsmotor, med handledning från vårt eget ML-team och ML-ingenjörerna på Modulai.

Automatiserade värderingsmodeller bygger traditionellt på tabulär data: boarea, antal rum, läge, byggår och historiska transaktioner. Två lägenheter med i princip identiska uppgifter kan ändå skilja sig avsevärt i marknadsvärde på grund av skick, renoveringsstandard, ljusinsläpp, planlösning och utsikt. Mycket av den signalen finns i annonsbilder, planritningar och flygfoton, men utnyttjas sällan bortom grova tumregler. Tidig forskning har visat att en inlärd "lyxnivå" baserad på interiör- och exteriörbilder, kombinerad med metadata, kan slå etablerade metadatabaserade skattningar (Poursaeed m.fl., 2017), och senare studier bekräftar att visuella features tillför prediktiv kraft utöver starka tabulära baslinjer (Kostic & Jevremović, 2021).

Det här examensarbetet behandlar bildsidan som ett representations- och integrationsproblem: vilka visuella representationer bär den signal som tabulära features missar, och hur bör de fusioneras in i en produktionssatt värderingsmodell utan att det försämrar robusthet, kalibrering eller förklarbarhet?

Kandidatrepresentationerna spänner över hela verktygslådan från bildklassificering (rumstyp, skick, renoveringsstandard), semantisk segmentering (material, ytor, grönska, planritningsgeometri), objektdetektering (öppna spisar, vitvaror, balkonger) till generella embeddings från förtränade vision- eller vision-språkmodeller.

Kärnidé: Utforska olika bildmodellsansatser för att representera bildinformation så effektivt som möjligt samtidigt som modellen förblir förklarbar, och undersöka hur sådana metoder kan förbättra värderingsträffsäkerheten för lägenheter och hus. Det metodologiska bidraget är jämförelsen och fusionsstrategin; det tillämpade bidraget är en validerad förbättring i ett system som faktiskt är i drift, Nezto Vision Engine™, som redan används i produktion av mäklarkedjor, fastighetsutvecklare och fastighetsplattformar.

Exempel på inriktningar

  • Systematisk jämförelse av representationsfamiljer: klassificeringshuvuden, segmenteringsmasker, detekterade objekt och råa embeddings — på lika villkor, mätt som marginell träffsäkerhet utöver vår starka tabulära baslinje
  • Färdiga vision-språkmodeller som attributextraktorer jämfört med specialtränade modeller och inlärda embeddings: träffsäkerhet, kostnad och latens per värdering
  • Fusionsarkitektur: sen fusion av poolade embeddings in i en gradient boosting-modell jämfört med end-to-end multimodal träning, inklusive hur ett varierande antal bilder per objekt ska aggregeras
  • Svag övervakning via prisresidualer: att lära in bildrepresentationer direkt mot den del av priset som vår tabulära modell inte kan förklara, i stället för att förlita sig på generiska förtränade features
  • Planritningar som strukturerad indata: extrahera planlösning, rumsangränsning och geometri, och testa om struktur slår utseende
  • Robusthet mot presentation: iscensatta bilder, vidvinkelobjektiv, HDR och skillnader mellan fotografer — att särskilja objektets kvalitet från marknadsföringens kvalitet
  • Osäkerhet och förklarbarhet: skiftar bilddata huvudsakligen punktskattningen eller gör den prediktionsintervallen snävare, och kan bidrag per bild attribueras på ett sätt som en mänsklig värderare skulle acceptera?

ML-tekniker och verktyg

  • Python, PyTorch, Git, Hugging Face
  • CNN- och vision-transformer-arkitekturer; förtränade embeddings (t.ex. CLIP, DINOv2) och vision-språkmodeller
  • Semantisk segmentering och objektdetektering (t.ex. SAM, Mask R-CNN, YOLO-familjen)
  • Multimodal fusion och gradient boosting (LightGBM/XGBoost) på kombinerad tabulär och bilddata
  • Förklarbarhet (SHAP, attention- och saliency-kartor) och osäkerhetskvantifiering (kvantilregression, konform prediktion)
  • Molnbaserad GPU-beräkning, experimentspårning och utvärdering på riktig data

Varför Nezto

Du får arbeta med storskalig, verklig annonsdata, GPU-kraft och nära handledning från både vårt ML-team och ML-ingenjörerna på Modulai, i en modell som faktiskt är i drift och används i produktion. Det är dessutom ett område som är ovanligt lätt att relatera till: alla bor någonstans.

Så ansöker du

Skicka din ansökan till hello@nezto.com.

Referenser

  • Poursaeed m.fl., Vision-based Real Estate Price Estimation, 2017. arXiv:1707.05489 — https://arxiv.org/abs/1707.05489
  • Kostic & Jevremović, What Image Features Boost Housing Market Predictions?, 2021. arXiv:2107.07148 — https://arxiv.org/abs/2107.07148
  • Zillows neurala nätverksestimat — https://www.zillow.com/news/building-the-neural-zestimate