Javascript must be enabled to continue!
Suomi24 alueellisen variaation aineistona
View through CrossRef
Tässä artikkelissa tarkastellaan Suomi24-verkkokeskusteluaineiston soveltuvuutta kirjoitetun puhekielen alueellisen variaation tutkimukseen. Lähtökohtana on havainto, että internetkeskustelut tarjoavat laajuudeltaan poikkeuksellisen aineistolähteen, mutta niiden käyttö murremaantieteellisessä tutkimuksessa on ongelmallista erityisesti puuttuvan paikkatiedon ja rekisterivariaation vuoksi. Tutkimuksessa selvitetään, kantaako Suomi24-aineisto aluepuhekielten tuottamaa alueellista signaalia, vaikka se ei edusta puhuttua kieltä eikä sisällä eksplisiittisiä paikkatunnisteita.
Aineistona käytetään Suomi24:n maakuntakohtaisia keskustelualueita, joita verrataan kahteen suomen murteiden alueellista vaihtelua kattavasti kuvaavaan aineistoon: Lauseopin arkiston murrekorpukseen ja Lauri Kettusen murrekartastoon. Alueellista variaatiota analysoidaan neljän kielenpiirteen avulla: inessiivin päätteiden, persoonapronominien, svaa-vokaalin sekä preesensin yksikön kolmannen persoonan pi-päätteen. Vertailu perustuu maakuntakohtaisiin suhteellisiin frekvensseihin ja niiden välisiin korrelaatioihin.
Tulokset osoittavat, että vaikka Suomi24-aineiston rekisterivariaation luonne vaikuttaa piirteiden suhteellisiin yleisyyksiin, aineistossa esiintyvät kielenpiirteet noudattavat pääosin aiemmassa murretutkimuksessa tunnistettuja alueellisia levikkejä. Artikkelin keskeinen tulos on, että Suomi24 kantaa tunnistettavaa aluepuhekielten signaalia ja on siten potentiaalisesti mielekäs aineisto murremaantieteelliseen tutkimukseen, kun rekisterivariaatio otetaan eksplisiittisesti huomioon.
The Suomi24 discussion forum as a corpus for regional variation in Finnish
This article examines the suitability of the Suomi24 online discussion corpus for the study of regional variation in Finnish. While internet discussion forums provide exceptionally large data sets, their use in dialectological research is complicated by a lack of explicit geographic metadata and by substantial register variation. The aim of this study is to assess whether Suomi24 data nevertheless carries a detectable signal of regional spoken varieties, despite representing written language.
The study focuses on discussions posted in regionally organised subforums of Suomi24 and compares their linguistic distributions with two established reference data sets of Finnish dialect variation: the Finnish Dialect Corpus of the Syntax Archive and the Finnish Dialect Atlas compiled by Lauri Kettunen. Regional variation is analysed using four linguistic features with well-documented dialectal distributions: inessive case endings, first- and second-person personal pronouns, the so-called schwa vowel, and the third-person singular present tense suffix -pi. The analysis is based on regionally aggregated relative frequencies and correlation measures between the data sets.
The results show that although register-related factors affect the relative frequencies of individual features in the Suomi24 corpus in different ways, their regional distributions largely align with patterns identified in traditional dialect research. The main contribution of the present article is to demonstrate that Suomi24 data carries a non-random and interpretable regional signal associated with spoken varieties. This suggests that, when register variation is explicitly addressed, Suomi24 constitutes a viable data source for large-scale dialectological and dialect-geographical research.
Title: Suomi24 alueellisen variaation aineistona
Description:
Tässä artikkelissa tarkastellaan Suomi24-verkkokeskusteluaineiston soveltuvuutta kirjoitetun puhekielen alueellisen variaation tutkimukseen.
Lähtökohtana on havainto, että internetkeskustelut tarjoavat laajuudeltaan poikkeuksellisen aineistolähteen, mutta niiden käyttö murremaantieteellisessä tutkimuksessa on ongelmallista erityisesti puuttuvan paikkatiedon ja rekisterivariaation vuoksi.
Tutkimuksessa selvitetään, kantaako Suomi24-aineisto aluepuhekielten tuottamaa alueellista signaalia, vaikka se ei edusta puhuttua kieltä eikä sisällä eksplisiittisiä paikkatunnisteita.
Aineistona käytetään Suomi24:n maakuntakohtaisia keskustelualueita, joita verrataan kahteen suomen murteiden alueellista vaihtelua kattavasti kuvaavaan aineistoon: Lauseopin arkiston murrekorpukseen ja Lauri Kettusen murrekartastoon.
Alueellista variaatiota analysoidaan neljän kielenpiirteen avulla: inessiivin päätteiden, persoonapronominien, svaa-vokaalin sekä preesensin yksikön kolmannen persoonan pi-päätteen.
Vertailu perustuu maakuntakohtaisiin suhteellisiin frekvensseihin ja niiden välisiin korrelaatioihin.
Tulokset osoittavat, että vaikka Suomi24-aineiston rekisterivariaation luonne vaikuttaa piirteiden suhteellisiin yleisyyksiin, aineistossa esiintyvät kielenpiirteet noudattavat pääosin aiemmassa murretutkimuksessa tunnistettuja alueellisia levikkejä.
Artikkelin keskeinen tulos on, että Suomi24 kantaa tunnistettavaa aluepuhekielten signaalia ja on siten potentiaalisesti mielekäs aineisto murremaantieteelliseen tutkimukseen, kun rekisterivariaatio otetaan eksplisiittisesti huomioon.
The Suomi24 discussion forum as a corpus for regional variation in Finnish
This article examines the suitability of the Suomi24 online discussion corpus for the study of regional variation in Finnish.
While internet discussion forums provide exceptionally large data sets, their use in dialectological research is complicated by a lack of explicit geographic metadata and by substantial register variation.
The aim of this study is to assess whether Suomi24 data nevertheless carries a detectable signal of regional spoken varieties, despite representing written language.
The study focuses on discussions posted in regionally organised subforums of Suomi24 and compares their linguistic distributions with two established reference data sets of Finnish dialect variation: the Finnish Dialect Corpus of the Syntax Archive and the Finnish Dialect Atlas compiled by Lauri Kettunen.
Regional variation is analysed using four linguistic features with well-documented dialectal distributions: inessive case endings, first- and second-person personal pronouns, the so-called schwa vowel, and the third-person singular present tense suffix -pi.
The analysis is based on regionally aggregated relative frequencies and correlation measures between the data sets.
The results show that although register-related factors affect the relative frequencies of individual features in the Suomi24 corpus in different ways, their regional distributions largely align with patterns identified in traditional dialect research.
The main contribution of the present article is to demonstrate that Suomi24 data carries a non-random and interpretable regional signal associated with spoken varieties.
This suggests that, when register variation is explicitly addressed, Suomi24 constitutes a viable data source for large-scale dialectological and dialect-geographical research.
Related Results
Piru vieköön ja voihan vittu
Piru vieköön ja voihan vittu
Kiroilu on voimakkaaksi koettua ja usein emotionaalisesti latautunutta kielenkäyttöä, johon sisältyy voimakas potentiaali herättää paheksuntaa. Aihe on herättänyt 1990-luvusta etee...
Ontologinen luokittelu ilmastonmuutoskeskustelun analysoinnissa – poliittinen kuluttajuus Suomi24-foorumilla
Ontologinen luokittelu ilmastonmuutoskeskustelun analysoinnissa – poliittinen kuluttajuus Suomi24-foorumilla
Artikkeli tarkastelee poliittista kuluttajuutta sosiaalisen median ilmastonmuutoskeskustelun kontekstissa. Lähestyn ilmiötä hermeneuttisella tutkimusotteella kulutuskulttuurin tutk...
Psychosocial Factor Identification in Cancer Patient Community
Psychosocial Factor Identification in Cancer Patient Community
Abstract
BackgroundThe open Suomi24 discussion forum, Finland’s largest topic-centric social media, provides excellent opportunities to study users’ interactions with vario...
Verkkokeskustelujen kansa
Verkkokeskustelujen kansa
People 'kansa' in digital discourses.
Corpus-assisted discourse analysis on Suomi24 discussion forum.
In this paper, our objective is to analyze how participants use...
Tunnekausatiivilauseen argumenttirakenne I
Tunnekausatiivilauseen argumenttirakenne I
Tunnekausatiivilauseet luokitellaan usein omaksi lausetyypikseen, johon kuuluu tunnetta tai tuntemusta ilmaiseva verbi (tunnekausatiivi), partitiivisijainen kokija ja nominatiivimu...
Tunnekausatiivilauseen argumenttirakenne II
Tunnekausatiivilauseen argumenttirakenne II
Suomen tunnekausatiivilause muodostuu tunnetta ilmaisevasta verbistä, johon liittyy tyypillisesti partitiivimuotoinen kokija, aiheuttaja tai kumpikin. Aiheuttaja voi olla paitsi no...
”Pohjoisen teksti” – kirjallisuudentutkimus kansallisen eetoksen rakentajana?
”Pohjoisen teksti” – kirjallisuudentutkimus kansallisen eetoksen rakentajana?
Artikkeli käsittelee venäläisten kirjallisuuden- ja kulttuurintutkijoiden 2000-luvulla kehittämää ”pohjoisen tekstin” (Severnyj tekst) kulttuurista konseptia. Aineistona ovat artik...
Kielen variaatio ja identiteetti arabia omana äidinkielenä -opetuksessa
Kielen variaatio ja identiteetti arabia omana äidinkielenä -opetuksessa
Artikkeli tarkastelee kielen ja identiteetin suhdetta arabia omana äidinkielenä -opetuksen kontekstissa. Artikkeli kysyy, kuinka opetukseen osallistuvat oppilaat itse ymmärtävät ar...

