Реферат: Информационный критерий оценки фонетической неопределенности

Вообще говоря, можно представить себе фонетические группы эталонных поверхностных форм, отличающиеся не только числом опор­ных фонем, но и их характером, а также порядком следования. Если учесть все три фактора, позволяющие разбить эталоны на существен­но большее число фонетических групп, то дальнейшие рассуждения можно отнести к каждой из этих групп. Для простоты, однако, бу­дем считать, что мы имеем М фонетических групп, в каждой из которых одинаковое число опорных сегментов. В практических за­дачах при разбиении на группы следует учитывать все эти факторы, однако необходимо строго ограничивать число различных опорных сегментов, выбирая лишь те, которые не путаются между собой и ха­рактеризуются групповыми признаками места образования - ударные гласные, смычные, фрикативные [81,80] .

Итак, допустим, что существуетM фонетических групп слов W1,W2,W3,…,Wn,…,Wm , в каждой из которых одинаковое число опорных квазифонемы. Общее число эталонов W= Un=1 m Wm , а ко­личество фонем, составляющих: слова (длина фонетической цепочки) каждой группы, обозначим через Lm; m=1, M.

Представляя таким образом слова словаря на входе СРР и ис­пользуя матрицы ошибочной классификации фонем, составляющих слова

P(a/b)=[Pij], (2.5)

можно оценить вероятности Pm(Vr/Ws) спутывания поверхностных форм слов внутри каждой группы слов следующим образом:

Pm (Vr/Ws)=П; (2.7)

Где T=1,2,..,Tmдлина фонетической цепочки группы слов Wm , ArtÎVr ,

BstÎWs.. В общем случае одно и то же слово Ws может иметь Ks, поверхностных форм, имеющих разное число фонетических элементов и попадающих в разные группы слов Wm . Поэтому общую услов­ную вероятность "спутывания" слов словаря определим

P(Vr/Ws)= (2.8)


Для определения потери информации в СРР, которая рассматрива­ется как канал передачи информации, в случае распознавания слов используем выражение

I(V/W)=-, (2.9)

То тогда 2I =( V / W ) определяет эквивалентный размер словаря - число альтернативных слов на входе системы распознавания, а 2I =( V ) - фактический объем входного словаря, где

I(V)=- , (2.10)

Эти выражения, аналогичные формулам (2.4), (2.5), оцениваю­щим фонетическую неопределенность, являются критерием оценки лексической неопределенности. Они определяют сложность распознава­ния словаря и позволяют судить о качестве СРР. При автоматичес­кой маркировке, наряду с ошибками неверной классификации фонем, существуют, как уже отмечалось, ошибки неверной сегментации, при­водящие к слиянию отрезков, соответствующих смежным фонемам, в один сегмент или расчленению отрезка, соответствующего одной фонеме, на несколько смежных фонем разных классов. При выборе альтернативных слов словаря надо следить за тем, чтобы неприят­ности такого рода не вызывали подобия последовательностей фоне­тических единиц, соответствующих разным словам. Для этого необ­ходимо использовать матрицы, отражающие возможные варианты сег­ментации слов словаря и частоты встречаемости тех или иных вари­антов сегментации, соответствующих различит поверхностным формам слов. Так как информация о словах, содержащихся в фонемах, избы­точна, то часто при оценке различимости слов словаря вполне достаточно использовать опорные фонемы, допускающие минимум оши­бок расчленения и слияния. Поэтому в формуле (2.7) для прибли­женной оценки спутывания слов необходимо в первую очередь ис­пользовать вероятности ошибочного распознавания таких опорных фонем, которые в данном слове не дают ошибок слияния и расчлене­ния.

К-во Просмотров: 226
Бесплатно скачать Реферат: Информационный критерий оценки фонетической неопределенности