Нехай точныя тэрміны і значэння працююць разам у пошуку.
Спалучыце спіс кандыдатаў на лексычнай і сэмантычной аснове, не спрыяючы таму, каб неканэксгэнтныя рэйтынгі пошуку былі вважаныя взаімназаменнымі.
Разработчык, які шукае ERR_CACHE_STALE, спакоўваецца на адпаведны код каштоўкі. Іншы разработчык можа описаць тую ж проблему як «програма продовжвае паказваць даны з вчора». Корисны пошук інформаціі павинен адпрацоўваць обе просьбы.
Лексычны пошук є корыстным, калі сама абаротка слоў несе інфармацыю. Семантычны пошук можа з’ѐднаць разныя апісанні одной ідэі. Спалучэнне гэтых двух методаў дае кожнаму з іх можлівасць знайсці доказы, якія праўільны пошук працягвае пераглядаць.
Рашэнне па дизайну — гэта там, дзе адбываецца такое спалучэнне.
Даўце кожнаму з апаратаў пошуку доступ да корпуса
Падазроўваючы, што семантычны пошук знаходзіць двадцать кандыдатаў, лексычны алгорытм сортуе іх. Гэта можа паспрабаваць пакращыць ўпорядкаванне, але точныя падабенства, якія знаходзяцца за межамі першых двадцаты, застаюць невиднымі.
Ёнкам, якія не падаюць пад зусім пад першы спосаб адзыскання, трэба працаваць пад другі спосаб і з’едыніць яго рэзультаты. У обох спосабах трэба выкорыстоўваць тыя ж правіла і фільтры для адбору даследжваных матэрыялаў. Дакумент, які быў адхоўлены таму, што яго ідэнтычнасць неясная, не должен зноў прайсці пад час адзыскання пада другым спосабам.
Гэта працуе безпасова на інвентары суроцэў: адзысканне дакументаў должна вестыся на адной падставе доказоў, якія вы гатовы выкарыстоўваць.
З’едыніце рангі, прычым не ствараючы новых формул для расчытку балоў
Бал BM25 і бал косай садоўпаданасці апісваюць разныя способы расчытку. Їх проста сумаванне дае цяжэр, але гэты цяжэр сама па сабе не мае значэння як сумарная релевантнасць.
Фузыя рангаў пада прычынам взаімнасці дае простую базовую падставу. Кожны список з рангамі дапамагае стварыць значэнне, якое залежыць ад пазіцыі кандыдата:
fused_score(document) = sum(1 / (c + rank_in_list))
Рангі зaczынаюцца ад однаго. Спіс не вяршыта нічога для дакумента, які ён не атрымал. Позытывныя сталяе c кантролюе, насколькі рэзкая ў змене ёсць дапамога между пазіцыямі.
Працоўная простата ёсць перавагай: для з’еднання не трэба, каб масштабы балавання былі аднаковыя. Аднойчы ўскладненням яўляецца тое, што губіцца величына балавання. Два суседзяючыя рэзультаты атрымліваюць падобную дапамогу, нават калі адны з інструментаў атрымання дакумента счылі іх вельмі разнымі.
Зберагаюце сталяе і колькасць кандыдатаў у настройках, а пасля яе ацэніце. Оони ёсць выборамі па дизайну, а не гарантіямі релевантнасці.
Удаліце дублікаты па ідэнтыфікаторы, а не па заглавле
Два інструментаў атрымання дакумента можу вернуць той самы фрагмент. З’еднайце гэты фрагмент па яго стабільным ідэнтыфікаторы, каб оба рангі вяршылі ў аднаго кандыдата. Не лічыце яго як два незалежныя доказы.
Загаловкі ўскладнююць ідэнтыфікацыю. Разныя статткі можаць мець аднаковы загалоўкі, а статтка можа змяніць свой загалоўк. Корыстны ключ часткі включае ідэнтыфікатор выхаднага джерага, версію контэнту і месца розташоўкі часткі.
Таксама трэба адразняць точныя дуплікаты від суседзячых частак у аднам разделе. Апошнія можаць знадобіцца аднародзіць пазней, як гаворыцца у методе часткавання для зберагчэння доказаў.
Тэставайце тыпы запитоў окрема
Іспользуйце прынеймна тры групы запытанняў: точныя ідэнтыфікаторы, канцэптуальныя апісанні і ўзмаўчанні як таго, так і другога. Пораўняйце адзін лексычны пошук, адзін семантычны пошук і рэзультат ўжыцця гэтых методаў.
Пераканайцеся, што стосунавыя доказы доходзяць да пулу кандыдатаў, прычым пераглядаючы якасць адпаведзей. Якщо з’яўленне ўжыцця дапамагае канцэптуальным запытанням, але шкодзіць запытанням з точнымі кодамі каштоўкаў, загальная сярэдняе значэнне можа закрыць важны регрэс.
Невялка тэхнічная бібліятэка можа вже добра працаваць з лексычным пошукам. Дадзіце сэмантычны адгуку, калі колькасць няверных рэзультатаў параджуе гэта. Зберагчы лексычны базовы рівень, таксама стае видна цэнная прыдатнасць дадзеных дапаможных механізмаў.
Перадаць корыстны скарбнік далей
Процэс фюзыі стварае скарбнік кандыдатаў, а не фактычную ацэнку. Документ з высокім рангам можа застацца застарэлым, непূরным або неактуальным па важныя крэтэрыі запытку.
Наступны этап можа перарангаваць кандыдатаў, выкарыстоўваючы сильнейшы сігнал рэлевантнасці. Але жадны пазнейшы этап рангавання не можа адзначыць доказы, якія ніколі не патрапілі ў скарбнік. Спачатку вымерыце ступень пакрыцча кандыдатаў; іншым чынам вы можете оптымаізаваць рэйтанг неправильных матэрыялаў.