See also ebooksgratis.com: no banners, no cookies, totally FREE.

CLASSICISTRANIERI HOME PAGE - YOUTUBE CHANNEL
Privacy Policy Cookie Policy Terms and Conditions
FASTA - Wikipedia

FASTA

出典: フリー百科事典『ウィキペディア(Wikipedia)』

FASTA は、DNA塩基配列タンパク質アミノ酸配列のシーケンスアライメントを行うための、バイオインフォマティクスソフトウェアパッケージである。

FASTA と同様にシーケンスアライメントを行うためのソフトウェアとして、BLAST なども知られる。

最初のバージョンは FASTP という名前であり、デヴィッド・J・リップマンとウィリアム・R・ピアスンが、1985年に開発して論文を発表した[1]

当初はタンパク質のアミノ酸配列のシーケンスデータベースに対して、アミノ酸配列の類似性 (similarity) の検索を行うように設計された。FASTA の1988年のバージョンでは、DNAの塩基配列の類似性を検索する機能が加えられた[2]。FASTA は FASTP よりも精巧なアルゴリズムで処理を行い、統計上の有意性を評価する。FASTA ソフトウェアパッケージには、タンパク質のアミノ酸配列やDNAの塩基配列のアライメントを行うための、いくつかのプログラムが含まれている。

FASTA は、"FAST-Aye" (ファストエー) と発音する。FASTA は、"FAST-P" (Protein; タンパク質) アライメント と "FAST-N" (Nucleotide; ヌクレオチド) アライメント の総称である、"FAST-All" を意味している。

FASTA ソフトウェアパッケージの現在のバージョンでは、次のようなことができる。なお、シーケンスデータベースに与える検索のシーケンスをクエリーという。

  • 塩基配列クエリーで塩基配列データベースを検索
  • 塩基配列クエリーをアミノ酸配列に翻訳してアミノ酸配列データベースを検索
  • アミノ酸配列クエリーでアミノ酸配列データベースを検索
  • アミノ酸配列クエリーで塩基配列データベース(アミノ酸配列に翻訳)を検索
  • 複数のペプチド(短いペプチド鎖)をクエリーとしてアミノ酸配列データベースを検索

フレームシフト突然変異を考慮した検索も可能である。Smith-Watermanアルゴリズムを実装した SSEARCH でのシーケンスデータベースの検索・比較をすることもできる(処理速度は遅くなる)。

FASTA ソフトウェアパッケージの主な用途は、類似性の精密な統計値を計算することである。類似性の統計値を計算することにより、生物学者は、どのアライメントが妥当性が高いかを判断することや、相同性 (homology) を推測することができる。

FASTA ソフトウェアパッケージは、ヴァージニア大学のFTPサーバから提供されている。

[編集] FASTAフォーマット

FASTA では、シーケンスデータの記述形式として FASTAフォーマットという形式を使う。FASTAフォーマットはプレーンテキストである。1つのシーケンスのデータは、">" で始まる1行のヘッダ行と、2行目以降の実際のシーケンス文字列で構成される。ヘッダ行では、">" の次にシーケンスデータを識別するための文字列を記述し、続けてそのシーケンスデータを説明する文字列を記述する(両方とも省略してよい)。ヘッダ行の ">" と識別文字列の間にスペースを入れてはいけない。FASTAフォーマットの全ての行は、80文字未満とすることが推奨される。">" で始まる別の行が出現すると、そこでシーケンスデータが区切られ、別のシーケンスデータが始まる。

FASTA ファイルフォーマットの例を示す。

>gi|5524211|gb|AAD44166.1| cytochrome b [Elephas maximus maximus]
LCLYTHIGRNIYYGSYLYSETWNTGIMLLLITMATAFMGYVLPWGQMSFWGATVITNLFSAIPYIGTNLV
EWIWGGFSVDKATLNRFFAFHFILPFTMVALAGVHLTFLHETGSNNPLGLTSDSDKIPFHPYYTIKDFLG
LLILILLLLLLALLSPDMLGDPDNHMPADPLNTPLHIKPEWYFLFAYAILRSVPNKLGGVLALFLSIVIL
GLMPFLHTSKHRSMMLRPLSQALFWTLTMDLLTLTWIGSQPVEYPYTIIGQMASILYFSIILAFLPIAGX
IENY

FASTAフォーマットでは、IUB/IUPAC で規定されているアミノ酸コードもしくは核酸コードで、シーケンス文字列を記述する。ただし、小文字で記述した場合は FASTA内部で自動的に大文字に変換される。また、"-" (ハイフン) でギャップを、"U" でセレノシステインを、"*" で翻訳終止を記述する。FASTAでは、クエリーのシーケンスに数字が含まれていると正しく処理をすることができない。FASTAで処理を行う前に、数字は、除去しておくか、適切な文字列("N" は不明な核酸塩基、"X" は不明なアミノ酸 を意味する)に置き換ておく必要がある。

FASTA で使える核酸のコード
核酸のコード 意味
A Adenosine (アデニン
C Cytidine (シトシン
G Guanine (グアニン
T Thymidine (チミン
U Uracil (ウラシル
R G A (puRine, プリン
Y T C (pYrimidine, ピリミジン
K G T (Ketone, ケトン
M A C (aMino group, アミノ基
S G C (Strong interaction, 強い結合
W A T (Weak interaction, 弱い結合)
B G T C (not A) (B, A の次の文字)
D G A T (not C) (D, C の次の文字)
H A C T (not G) (H, G の次の文字)
V G C A (not T, not U) (V, U の次の文字)
N A G C T (aNy, 不明)
- ギャップ
FASTA で使えるアミノ酸コード
アミノ酸コード 意味
A アラニン
B アスパラギン酸 もしくは アスパラギン
C システイン
D アスパラギン酸
E グルタミン酸
F フェニルアラニン
G グリシン
H ヒスチジン
I イソロイシン
K リシン
L ロイシン
M メチオニン
N アスパラギン
P プロリン
Q グルタミン
R アルギニン
S セリン
T スレオニン
U セレノシステイン
V バリン
W トリプトファン
Y チロシン
Z グルタミン酸 もしくは グルタミン
X 不明 (any)
* 翻訳終止
- ギャップ

[編集] 参考文献

  1. ^ Lipman, D. J.; Pearson, W.R. (1985). "Rapid and sensitive protein similarity searches." Science 227 (4693): 1435–1441. PMID 2983426.
  2. ^ Pearson, W.R.; Lipman, D. J. (1988). "Improved tools for biological sequence comparison." Proc. Natl. Acad. Sci. USA 85 (8): 2444–2448. PMID 3162770

[編集] 外部リンク


aa - ab - af - ak - als - am - an - ang - ar - arc - as - ast - av - ay - az - ba - bar - bat_smg - bcl - be - be_x_old - bg - bh - bi - bm - bn - bo - bpy - br - bs - bug - bxr - ca - cbk_zam - cdo - ce - ceb - ch - cho - chr - chy - co - cr - crh - cs - csb - cu - cv - cy - da - de - diq - dsb - dv - dz - ee - el - eml - en - eo - es - et - eu - ext - fa - ff - fi - fiu_vro - fj - fo - fr - frp - fur - fy - ga - gan - gd - gl - glk - gn - got - gu - gv - ha - hak - haw - he - hi - hif - ho - hr - hsb - ht - hu - hy - hz - ia - id - ie - ig - ii - ik - ilo - io - is - it - iu - ja - jbo - jv - ka - kaa - kab - kg - ki - kj - kk - kl - km - kn - ko - kr - ks - ksh - ku - kv - kw - ky - la - lad - lb - lbe - lg - li - lij - lmo - ln - lo - lt - lv - map_bms - mdf - mg - mh - mi - mk - ml - mn - mo - mr - mt - mus - my - myv - mzn - na - nah - nap - nds - nds_nl - ne - new - ng - nl - nn - no - nov - nrm - nv - ny - oc - om - or - os - pa - pag - pam - pap - pdc - pi - pih - pl - pms - ps - pt - qu - quality - rm - rmy - rn - ro - roa_rup - roa_tara - ru - rw - sa - sah - sc - scn - sco - sd - se - sg - sh - si - simple - sk - sl - sm - sn - so - sr - srn - ss - st - stq - su - sv - sw - szl - ta - te - tet - tg - th - ti - tk - tl - tlh - tn - to - tpi - tr - ts - tt - tum - tw - ty - udm - ug - uk - ur - uz - ve - vec - vi - vls - vo - wa - war - wo - wuu - xal - xh - yi - yo - za - zea - zh - zh_classical - zh_min_nan - zh_yue - zu -