Текстовая семантика произведений

Автор: Дмитрий Малыхин (i@dmalyhin.ru).

Шесть каналов

Для нормализованного произведения используются:

Tm — main_idea
Ts — subject / D1
Tt — thesis / D2
Td — полное description
Tr — structure / D3
Tk — mechanism / D4

Каждый канал кодируется независимо и нормализуется по L2-норме.

Центральное смысловое ядро

Для пары a,b:

smm = cos(Em(a), Em(b))
stt = cos(Et(a), Et(b))
smt = cos(Em(a), Et(b))
stm = cos(Et(a), Em(b))

При wm=0.65, wd=0.35 и доле перекрёстного сопоставления c=0.30:

central(a,b) =
  0.455·smm
+ 0.245·stt
+ 0.150·smt
+ 0.150·stm

Если часть каналов отсутствует, доступные веса перенормируются.

Профиль описания

profile(a,b) =
  0.45·cos(Es(a),Es(b))
+ 0.30·cos(Ed(a),Ed(b))
+ 0.10·cos(Er(a),Er(b))
+ 0.15·cos(Ek(a),Ek(b))

Итог

score_text(a,b) = 0.65·central(a,b) + 0.35·profile(a,b)

Содержательный шлюз

Структура и механизм не могут создать рекомендацию сами. Требуется достаточное совпадение в содержательных каналах:

gate(a,b) = max(
  main_idea↔main_idea,
  subject↔subject,
  thesis↔thesis,
  main_idea↔thesis,
  thesis↔main_idea
)

Кандидат проходит только если одновременно выполнены порог score_text и порог gate.

Резервное ролевое представление

Если четыре предложения описания не удаётся детерминированно разобрать на D1–D4, аналитический слой может использовать полное описание как резервное представление. Недостающие роли не реконструируются догадкой.