پرسیکا پیکرهای است حاوی متون خبری برگرفته از خبرگزاری ایسنا. متون این پیکره در یازده طبقه موضوعی شامل ورزشی، اقتصادی، فرهنگی، مذهبی، تاریخی، سیاسی، علمی، اجتماعی، آموزشی، حقوق قضایی، بهداشت طبقهبندی شدهاند و پیشپردازشهایی به منظور قابل استفاده بودن در کاربردهای مختلف پردازش زبان طبیعی و دادهکاوی بر روی آنها انجام گرفته است.
پژوهشهای مرتبط:
کاربردها:
متنکاوی، طبقهبندی متون، پردازش زبان طبیعی، زبانشناسی رایانشی
اطلاعات تکمیلی:
– http://sourceforge.net/projects/persica
– این مجموعه در دو قالب SQL و CVS برای دانلود موجود است.
پیکره – پرسیکا (پیکره متون خبری)