Текстовая семантика произведений
Автор: Дмитрий Малыхин (i@dmalyhin.ru).
Шесть каналов
Для нормализованного произведения используются:
Tm — main_idea
Ts — subject / D1
Tt — thesis / D2
Td — полное description
Tr — structure / D3
Tk — mechanism / D4
Каждый канал кодируется независимо и нормализуется по L2-норме.
Центральное смысловое ядро
Для пары a,b:
smm = cos(Em(a), Em(b))
stt = cos(Et(a), Et(b))
smt = cos(Em(a), Et(b))
stm = cos(Et(a), Em(b))
При wm=0.65, wd=0.35 и доле перекрёстного сопоставления c=0.30:
central(a,b) =
0.455·smm
+ 0.245·stt
+ 0.150·smt
+ 0.150·stm
Если часть каналов отсутствует, доступные веса перенормируются.
Профиль описания
profile(a,b) =
0.45·cos(Es(a),Es(b))
+ 0.30·cos(Ed(a),Ed(b))
+ 0.10·cos(Er(a),Er(b))
+ 0.15·cos(Ek(a),Ek(b))
Итог
score_text(a,b) = 0.65·central(a,b) + 0.35·profile(a,b)
Содержательный шлюз
Структура и механизм не могут создать рекомендацию сами. Требуется достаточное совпадение в содержательных каналах:
gate(a,b) = max(
main_idea↔main_idea,
subject↔subject,
thesis↔thesis,
main_idea↔thesis,
thesis↔main_idea
)
Кандидат проходит только если одновременно выполнены порог score_text и порог gate.
Резервное ролевое представление
Если четыре предложения описания не удаётся детерминированно разобрать на D1–D4, аналитический слой может использовать полное описание как резервное представление. Недостающие роли не реконструируются догадкой.