Search engine for discovering works of Art, research articles, and books related to Art and Culture
ShareThis
Javascript must be enabled to continue!

Desafios na padronização da anotação genômica

View through CrossRef
A bioinformática é uma área relativamente nova na intersecção da biologia e ciência da computação. Ainda assim, trouxe consigo diversos avanços tecnológicos que atualmente são considerados imprescindíveis para o meio científico mundial [1]. Podemos citar a exemplo as diversas atualizações das tecnologias de sequenciamento que ocorreram somente nas últimas duas décadas [2]. Todavia, sendo uma área do saber recente, a bioinformática quanto à ciência ainda possui pontos de melhoria. Nesse contexto, um tópico que sempre está em voga é a pouca padronização da anotação genômica [3]. O processo de anotação é essencial para o desenvolvimento de metodologias cuja base parte da análise do material genético, tais como pan-genômica e taxogenômica. Em suma, essa etapa da genômica comparativa consiste em dar sentido à sequências biológicas, indicando pontos relacionados aos padrões de presença gênica, possíveis produtos e possíveis funções [4]. Contudo, esse é um passo que, acima de qualquer outro ponto, é dependente de comparações contra bancos de dados. Afinal, para se conhecer o produto que melhor deriva de uma sequência, é preciso comparar a sequência em questão contra outras possíveis candidatas já estudadas [5]. Porém, em bancos de dados imensos e não-curados, sequências idênticas podem possuir diferentes nomes de produto e estarem relacionadas a diferentes genes, ou seja, duas sequencias iguais recebem por vezes nomes não-sinônimos que confundem as ferramentas de predição de contaminam os bancos de dados com informações equivocadas. Outra questão é a presença de genes ou proteínas fragmentadas em bancos de dados utilizados para anotação. Utilizar dados dessa qualidade diminui a acurácia da anotação, já que por vezes pode alterar a fase de leitura ou levar a predição de pseudogenes [6-7]. Pela lógica então, o problema da padronização da anotação genômica deriva diretamente da ausência de padronização dos bancos de dados utilizados para essa função [5-8]. Figura 1: Simplificação gráfica do processo de anotação gênica em um genoma bacteriano. Fonte: próprio autor. Não obstante, existem alternativas que contornam o problema. Caso apenas uma anotação simples seja necessária, é possível realizar uma anotação automática de todo um dataset de genomas por meio de uma mesma ferramenta ou pipeline. Esse passo visa padronizar os meios de comparação entre as sequências incluídas na análise, garantindo que todas foram comparadas pelo mesmo método e contra as mesmas referências. Porém, essa opção culmina em um passo adicional no pipeline de genômica comparativa, que por vezes é por si só extenso, e pode ser custoso temporalmente a depender do dataset inicial. Ao utilizar uma mesma ferramenta para a comparação e o mesmo banco de dados biológicos, espera-se que sequências similares sejam computadas pela mesma métrica e possuam a mesma terminologia e nomenclatura [7]. Tal fato implica em uma melhor acurácia do resultado final, e permite que o analista trabalhe com um dado limpo e não redundante Outra alternativa é utilizar anotações públicas de um mesmo banco de dados genômico. Com a criação do banco RefSeq, houve um aumento na qualidade da anotação de genomas disponíveis na plataforma National Center for Biotechnology Information (NCBI) – um dos maiores repositórios de genes e genomas do mundo [9-10]. Essa melhora nas características gerais de anotações públicas do NCBI se deve à uma curadoria fina dos dados depositados globalmente pelos desenvolvedores e envolvidos com a plataforma. A utilização de dados curados aumenta o número de proteínas hipotéticas preditas ao final do processo de anotação, porém eleva a qualidade dos produtos anotados pois garante sua veracidade. Esse foi um passo importante para melhorar a reprodutibilidade de trabalhos genômicos, todavia, essa padronização ainda carece de curadoria por parte daqueles que obtêm esses dados [11]. Portanto, cabe ao bioinformata ou simpatizante da bioinformática a tarefa de selecionar o melhor banco de dados para realizar o processo de anotação, além de desenvolver métodos que solucionem o problema a longo prazo. Vale ressaltar que a bioinformática é uma potência científica, tendo como proposta auxiliar na busca pela solução de problemas biológicos complexos, sendo portanto a área mais adequada para lidar com essa problemática relacionada a ninguém menos que ela mesma.
Title: Desafios na padronização da anotação genômica
Description:
A bioinformática é uma área relativamente nova na intersecção da biologia e ciência da computação.
Ainda assim, trouxe consigo diversos avanços tecnológicos que atualmente são considerados imprescindíveis para o meio científico mundial [1].
Podemos citar a exemplo as diversas atualizações das tecnologias de sequenciamento que ocorreram somente nas últimas duas décadas [2].
Todavia, sendo uma área do saber recente, a bioinformática quanto à ciência ainda possui pontos de melhoria.
Nesse contexto, um tópico que sempre está em voga é a pouca padronização da anotação genômica [3].
O processo de anotação é essencial para o desenvolvimento de metodologias cuja base parte da análise do material genético, tais como pan-genômica e taxogenômica.
Em suma, essa etapa da genômica comparativa consiste em dar sentido à sequências biológicas, indicando pontos relacionados aos padrões de presença gênica, possíveis produtos e possíveis funções [4].
Contudo, esse é um passo que, acima de qualquer outro ponto, é dependente de comparações contra bancos de dados.
Afinal, para se conhecer o produto que melhor deriva de uma sequência, é preciso comparar a sequência em questão contra outras possíveis candidatas já estudadas [5].
Porém, em bancos de dados imensos e não-curados, sequências idênticas podem possuir diferentes nomes de produto e estarem relacionadas a diferentes genes, ou seja, duas sequencias iguais recebem por vezes nomes não-sinônimos que confundem as ferramentas de predição de contaminam os bancos de dados com informações equivocadas.
Outra questão é a presença de genes ou proteínas fragmentadas em bancos de dados utilizados para anotação.
Utilizar dados dessa qualidade diminui a acurácia da anotação, já que por vezes pode alterar a fase de leitura ou levar a predição de pseudogenes [6-7].
Pela lógica então, o problema da padronização da anotação genômica deriva diretamente da ausência de padronização dos bancos de dados utilizados para essa função [5-8].
Figura 1: Simplificação gráfica do processo de anotação gênica em um genoma bacteriano.
Fonte: próprio autor.
Não obstante, existem alternativas que contornam o problema.
Caso apenas uma anotação simples seja necessária, é possível realizar uma anotação automática de todo um dataset de genomas por meio de uma mesma ferramenta ou pipeline.
Esse passo visa padronizar os meios de comparação entre as sequências incluídas na análise, garantindo que todas foram comparadas pelo mesmo método e contra as mesmas referências.
Porém, essa opção culmina em um passo adicional no pipeline de genômica comparativa, que por vezes é por si só extenso, e pode ser custoso temporalmente a depender do dataset inicial.
Ao utilizar uma mesma ferramenta para a comparação e o mesmo banco de dados biológicos, espera-se que sequências similares sejam computadas pela mesma métrica e possuam a mesma terminologia e nomenclatura [7].
Tal fato implica em uma melhor acurácia do resultado final, e permite que o analista trabalhe com um dado limpo e não redundante Outra alternativa é utilizar anotações públicas de um mesmo banco de dados genômico.
Com a criação do banco RefSeq, houve um aumento na qualidade da anotação de genomas disponíveis na plataforma National Center for Biotechnology Information (NCBI) – um dos maiores repositórios de genes e genomas do mundo [9-10].
Essa melhora nas características gerais de anotações públicas do NCBI se deve à uma curadoria fina dos dados depositados globalmente pelos desenvolvedores e envolvidos com a plataforma.
A utilização de dados curados aumenta o número de proteínas hipotéticas preditas ao final do processo de anotação, porém eleva a qualidade dos produtos anotados pois garante sua veracidade.
Esse foi um passo importante para melhorar a reprodutibilidade de trabalhos genômicos, todavia, essa padronização ainda carece de curadoria por parte daqueles que obtêm esses dados [11].
Portanto, cabe ao bioinformata ou simpatizante da bioinformática a tarefa de selecionar o melhor banco de dados para realizar o processo de anotação, além de desenvolver métodos que solucionem o problema a longo prazo.
Vale ressaltar que a bioinformática é uma potência científica, tendo como proposta auxiliar na busca pela solução de problemas biológicos complexos, sendo portanto a área mais adequada para lidar com essa problemática relacionada a ninguém menos que ela mesma.

Related Results

FPGA and ASIC accelerators for genome data analysis
FPGA and ASIC accelerators for genome data analysis
(English) The continuous progress of Moore’s Law in improving single-threaded performance (execution time) through clock frequency and process node improvements has slowed down du...
UMA PROPOSTA DE WORKFLOW PARA CONSTRUÇÃO DE CORPUS DIGITAL EM LÍNGUA DE SINAIS
UMA PROPOSTA DE WORKFLOW PARA CONSTRUÇÃO DE CORPUS DIGITAL EM LÍNGUA DE SINAIS
Os corpora de línguas de sinais disponíveis atualmente em pesquisas linguísticas e em sites para acesso livre são constituídos por um módulo de gravação feita em vídeo, pois os dad...
Seleção de marcadores utilizando probabilidade a posteriori de inclusão no modelo para predição genômica
Seleção de marcadores utilizando probabilidade a posteriori de inclusão no modelo para predição genômica
Com o aumento constante da população mundial, a demanda por alimentos está crescendo diariamente, embora as áreas agricultáveis estejam chegando ao seu limite territorial. Uma solu...
Random Forest Quantílico aplicado em estudos de seleção genômica
Random Forest Quantílico aplicado em estudos de seleção genômica
A seleção genômica ampla (GWS) utiliza marcadores distribuídos por todo o genoma para predizer o valor genético genômico de indivíduos. Esta abordagem possibilita acelerar o proces...
Long-term dynamics of marine microbiomes: from communities to populations
Long-term dynamics of marine microbiomes: from communities to populations
(English) The surface ocean harbours a vast diversity of microorganisms, including prokaryotes (bacteria and archaea), which are key drivers of global biogeochemical cycles. Unders...
Ciência Aberta e os Desafios para o Compartilhamento de Dados de Pesquisa Genômica.
Ciência Aberta e os Desafios para o Compartilhamento de Dados de Pesquisa Genômica.
Este trabalho, discute os desafios para o compartilhamento de dados de pesquisa genômica alinhado aos princípios FAIR. Para compreender melhor o campo, é proposto o Modelo de Fator...
IMPACTO DA DESCRIÇÃO DE MATERIAIS PELA ENFERMAGEM NAS GLOSAS DURANTE A AUDITORIA
IMPACTO DA DESCRIÇÃO DE MATERIAIS PELA ENFERMAGEM NAS GLOSAS DURANTE A AUDITORIA
A auditoria é uma ferramenta utilizada pelos serviços de saúde para a melhoria de processos, potencialização de adequada utilização dos recursos disponíveis e alcance dos resultado...
O modelo de dependências universais: assentando bases teóricas e revisando diretrizes metodológicas
O modelo de dependências universais: assentando bases teóricas e revisando diretrizes metodológicas
As Dependências Universais (UDs) são um modelo de anotação morfossintática de línguas naturais. Este artigo parte do pressuposto de que na base do modelo ficam previstas a adequaçã...

Back to Top