Bioinformatyka4.pdf

(961 KB) Pobierz
Wykład Bioinformatyka
Bioinformatyka
Wykład 4.
E. Banachowicz
Zakład Biofizyki Molekularnej
IF UAM
http://www.amu.edu.pl/~ewas
Formaty danych - GenBank
Poco wprowadza się dane do komputerów?
1. żeby je pobrać
2. żeby coś odkryć
Jeśli baza danych nie pozwala na wyszukanie potrzebnej
informacji, jest by bezużyteczna. (Nawet największa baza!)
Wykład 4, 2008
1
Wykład Bioinformatyka
Formaty danych - GenBank
1. dane muszą mieć jednoznaczną strukturę
i zdefiniowane powiązania
2. dane muszą być stabilne
Model danych w NCBI oparty jest na sekwencji DNA
(stabilność), i daje możliwość śledzenia informacji od literatury
do sekwencji.
Stabilność danych
OMIM
literatura
PubMed
Full Text
el. Journal
sekwencja
DNA
struktura
3D
Mapy i
genomy
sekwencja
białka
Taksonomia
4 podstawowe dane
Wykład 4, 2008
2
Wykład Bioinformatyka
pliki ASCII
• większość programów do analizy sekwencji
nie akceptuje znaków spoza zestawu ASCII
(różna interpretacja, problemy z transferem)
• Poza sekwencją DNA lub białka (raw sequence) –
odpowiedni format
• Kod DNA i białka ujednolicony został przez
NC-IUB (
Nomenclature Committee of the International Union of
Biochemistry and Molecular Biology -
http://www.chem.qmul.ac.uk/iubmb/
Zasady/kwasy nukleinowe
- ujednolicony kod
NC – IUP (1984)
A
adenozyna
C
cytozyna
G
guanina
T
tymidyna
U
urydyna
R
G A (puryna)
Y
T C (pyrymidyna)
K
G T (keto)
M
A C (amino)
S
G C (strong)
W
A T (weak)
B
GTC
D
GAT
H
ACT
V
GCA
N
A G C T (dowolna)
-
gap of indeterminate length
Wykład 4, 2008
3
Wykład Bioinformatyka
Standardowy kod aminokwasów
A
B
C
D
E
F
G
H
I
K
L
M
N
Ala
alanina
P
Pro
prolina
Asx
kw. asparaginowy/asparagina Q
Gln
glutamina
Cys
cysteina
R
Arg
arginina
Asp
kw. asparaginowy
S
Ser
seryna
Glu
kw. glutaminowy
T
Thr
treonina
Phe
fenyloanina
U
selenocysteina
Gly
glicyna
V
Val
walina
His
histydyna
W
Trp
tryptofan
Ile
izoleucyna
Y
Tyr
tyrozyna
Lys
lizyna
Z
Glx
kw.glutaminowy/glutamina
Leu
leucyna
X
Xxx
dowolny
Met
metionina
*
stop translacji
Asn
asparagina
-
gap of indeterminate length
Abstract Syntax Notation Sequence Format ASN.1
ASN.1
(skrót od
Abstract Syntax Notation One
abstrakcyjna notacja składniowa numer jeden)
język opisu danych przejęty i rozwijany przez NCBI
Wykład 4, 2008
4
Wykład Bioinformatyka
Integracja danych z wielu różnych źródeł
• np. PubMed
(np. wyszukiwanie według autorów)
MEDLINE Display
Tag
AB
AD
AID
AU
CI
CIN
CN
CON
CRF
CRI
DA
DCOM
DEP
DP
EDAT
EFR
EIN
FAU
FIR
FPS
GN
GR
GS
IP
IR
IRAD
IS
JID
JT
LA
LID
Name
Abstract
Affiliation
Article Identifier
Author
Copyright Information
Comment In
Corporate Author
Comment On
Corrected and republished from
Corrected and republished in
Date Created
Date Completed
Date of Electronic Publication
Publication Date
Entrez Date
Erratum For
Erratum In
Full Author Name
Full Investigator
Full Personal Name as Subject
General Note
Grant Number
Gene Symbol
Issue
Investigator
Investigator Affiliation
ISSN
NLM Unique ID
Full Journal Title
Language
Location ID
LR
MH
MHDA
OAB
OCI
OID
ORI
OT
OTO
OWN
PG
PHST
PL
PMID
PRIN
PROF
PS
PST
PT
PUBM
RF
RIN
RN
ROF
RPF
RPI
SB
SFM
SI
SO
SPIN
STAT
TA
TI
TT
UIN
UOF
VI
Last Revision Date
MeSH Terms
MeSH Date
Other Abstract
Other Copyright Information
Other ID
Original Report In
Other Term
Other Term Owner
Owner
Pagination
Publication History Status Date
Place of Publication
PubMed Unique Identifier
Partial Retraction In
Partial Retraction Of
Personal Name as Subject
Publication Status
Publication Type
Publishing Model
Number of References
Retraction In
EC/RN Number
Retraction Of
Republished From
Republished In
Subset
Space Flight Mission
Secondary Source Identifier
Source
Summary For Patients In
Status Tag
Journal Title Abbreviation
Title
Transliterated Title
Update In
Update Of
Volume
Wykład 4, 2008
5
Zgłoś jeśli naruszono regulamin