1975
🧬 بیوانفورشیمی: انقلاب زیستی با ترکیب مولکولهای بدن، AI و محاسبات کامپیوتری! 💻🧪 از wet lab تا dry lab، آموزش ساده مفاهیم پیچیده، اخبار داغ، پروژههای عملی، ایدههای بیزینسی و سرگرمی علمی! 🚀💊 چه دانشجو باشی، استاد، پزشک یا برنامهنویس، اینجا جای توعه
سلام به همه 👋
میخواستم ابزاری رو که مدتی روش کار کردم بهتون معرفی کنم: GMXLens — یک بستهی تحلیل مسیر (trajectory) برای شبیهسازیهای دینامیک ملکولی GROMACS.
چی کار میکنه؟
شما فایل topology و trajectory رو میدید، GMXLens کل پایپلاین رو اجرا میکنه: تصحیح PBC، بیش از ۲۰ تحلیل (کانتکتهای پروتئین-لیگاند، پیوند هیدروژنی، SASA، RMSD، FEL، کلاسترینگ و...)، و در نهایت یک تفسیر آماری که برای مقاله مناسب هست.
چند نکتهی جالب:
- خطاهای معیار همهی خروجیها با اصلاح همبستگی (autocorrelation) محاسبه میشن — نه σ/√n ساده
- گذارهای ساختاری با فاصلهی اطمینان بوتاسترپ گزارش میشن
- برای هر ران، یک فایل statistical_methods.md خودکار ساخته میشه که مستقیم قابل paste در بخش Methods مقاله هست (ویرایش شخصی لازمه)
- کانتکتها و SASA روی GPU اجرا میشن (با CuPy) — SASA تا ۲۰۰۰ برابر سریعتر
- مطالعات چند-replicate با اجرای موازی و آمار بینگروهی
- رابط گرافیکی با PySide6 و حالت راهنما (guided mode) برای کاربران تازهکار
- رایگان و open-source (MIT License)
لینک:
🔗 https://github.com/drvahidzarezade-Bioinf/gmxlens
نصب:
pip install git+https://github.com/drvahidzarezade-Bioinf/gmxlens.git
git clone https://github.com/drvahidzarezade-Bioinf/gmxlens.git
cd gmxlens && conda env create -f environment.yml && conda activate gmxlens
مفهوم ماتریس درهمریختگی (Confusion Matrix) در هوش مصنوعی و یادگیری ماشین
#هوش_مصنوعی
@Artificial_Intelligence_Center
ممنونم ازتون
دکتر من با فاصلهی 0.2 هر window رو انتخاب کردم و هر کدوم رو 20 نانوثانیه براش ران گذاشتم.
این خروجیها هست.
میخواستم از خدمتتون سوال بپرسم بنظرتون مدت ران ها باید طولانی بشه یا تعداد فریم هایی که انتخاب شدن؟ ممنون میشم نظر ارزشمندتون رو بفرمایید
واقعا کمک بزرگیه برام
یکی از عزیزان در مورد مشکل احتمالی در نتایج شبیه سازی دینامیک مولکولی هدایت شده یا SMDسوالی پرسیدن که برای به اشتراک گذاری تجربیاتمون میذارم اینجا. من پاسخ خودم رو هم share میکنم اگر شما هم کامنتی دارید تبادل کنید.
Читать полностью…
سوال یکی از محققین:
سلام وقت بخیر
برای پیدا کردن مهارکننده های دارای پتانسیل بعد از انجام داکینگ و شبیه سازی چطور باید off target آنالیز انجام بشه؟
و پاسخ بنده:
مقالات مشابه رو ببینید و ایده هاشون رو بررسی کنید.
بطور کلی و به لحاظ منطقی شما باید ببینید لیگاند شما به چه پروتئین هایی به جز تارگت اصلیتون احتمالا متصل خواهد شد. بنابراین اول نیاز به یک شبکه اینترکشن دارو - پروتئین دارید که میتونید از دیتابیس های مختلفی بدست بیارید. بعد ببرید توی cytoscape آنالیز کنید و یه لیست از تارگت ها رو استخراج کنید. سپس با استفاده از تکنیک reverse docking تمایل اتصالی رو بسنجید و بعدشم شبیه سازی و انرژی اتصال و...
یه ابزار خوب برای reverse docking:
https://yogeshgaikwad-labhelper.github.io/multidockweb.github.io/index.html
شما هم اگر تجربه ای دارید به اشتراک بذارید تا ما و بقیه یاد بگیریم.
🆔
کانال بیوانفورشیمی
گروه بیوانفورشیمی
جدیدترین نسخه ویندوزی نرم افزار VMD ورژن2 با ظاهری متفاوت، رابط کاربری آسان تر و امکانات بیشتر برای پژوهشگران محاسباتی.
🆔
کانال بیوانفورشیمی
گروه بیوانفورشیمی
هر چند که کامنت هایی به مقاله وارد هست، ولی برای فهم بهتر الگوها و کسب ایده در زمینه طراحی دارو و مطالعات متاآنالیز مقاله ی بدکی نیست. کاملا محاسباتی و پابلیش شده در اسکوپ مرتبط...
Читать полностью…
▫️چه زمانی باید استفاده از هوش مصنوعی مولد را به ناشر اعلام کنیم؟
ناشران معتبر بینالمللی دستورالعملهایی برای استفاده از هوش مصنوعی مولد در نگارش مقالات و کتابها تدوین کردهاند. در راهنمای هوش مصنوعی انتشارات وایلی (Wiley) آمده است که در صورت استفاده از هوش مصنوعی در موارد زیر، لازم است نویسندگان موضوع را به ناشر اعلام کنند:
1️⃣ هنگامی که بخشی از خروجی تولیدشده توسط هوش مصنوعی را بهصورت مستقیم (verbatim) در اثر خود به کار میبرید؛
2️⃣ هنگامی که محتوای موجود را بهطور قابل توجهی با کمک هوش مصنوعی ویرایش میکنید؛
3️⃣ هنگامی که مواد تکمیلی (supplementary materials) مانند تصویر، جدول یا نمودار را با استفاده از هوش مصنوعی تولید میکنید؛
4️⃣ هنگامی که تحلیلهای مهمی انجام میدهید که بر نتیجهگیریهای پژوهش شما اثرگذار است.
وایلی موارد استفاده از هوش مصنوعی مولد در محتوای علمی را در چهار دستهی اصلی طبقهبندی کرده است:
نگارش و ویرایش متن (Writing and Editing)
پژوهش و تحلیل (Research and Analysis)
محتوای بصری (Visual Content)
محتوای آموزشی (Educational Content)
سپس در قالب جدولی، مواردی را که نیازمند اعلان (Declaration) و افشا (Disclosure) هستند و نیز مواردی که به چنین اقدامی نیاز ندارند، مشخص کرده است. در ادامه به این موارد اشاره میشود.
نگارش و ویرایش متن
نیازمند افشا:
نگارش یا ویرایش بخشهایی از دستنوشته
تولید مثال یا مطالعات موردی
ترجمه محتوا
نگارش یا بازنویسی بخشهای اساسی دستنوشته
ارائه تحلیلهایی که بر استدلالها یا نتیجهگیری اثرگذار است
نیازی به افشا نیست:
اصلاحات جزئی گرامری یا املایی
رفع اشکال نگارشی و نشانهگذاری
انتخاب عنوان فصل یا بخش
استفاده جزئی یا کماهمیت از خروجی هوش مصنوعی مانند اضافه کردن یک کلمه
پژوهش و آنالیز
نیازمند افشا:
سنتز یا آنالیز متون
استدلال علمی
شناسایی شکافهای پژوهشی
استفاده از رفرنسهای تولیدشده توسط هوش مصنوعی
آنالیز و تفسیر داده
تولید یا تغییر کد
نیازی به افشا نیست:
جستجوی ساده در متون علمی
فرمتبندی رفرنسها
مدیریت رفرنسها
جستجو در دیتابیسها
محتوای بصری
نیازمند افشا:
تولید یا تغییر تصاویر، نمودارها و گرافها
تولید یا ویرایش عکسها
نیازی به افشا نیست:
تغییرات جزئی مانند تغییر اندازه یا تنظیم روشنایی و کنتراست
محتوای آموزشی
نیازمند افشا:
ایجاد تمرین یا سؤالات آموزشی
طراحی سوالات یا روبریکها
نیازی به افشا نیست:
فرمتبندی ساده مطالب آموزشی
منبع
🆔
کانال بیوانفورشیمی
گروه بیوانفورشیمی
🎯 چطوری یه Cover Letter بنویسیم که ادیتور رو وادار به توجه کنه!!
خیلی وقتها نویسندگان کل انرژی رو روی مقاله میذارن و Cover Letter رو در حد یک تشریفات کوتاه مینویسن.
اما حقیقت اینه که ادیتور قبل از خوندن مقاله، همین نامه رو میبینه.
و تصمیم اولیهاش (reject یا ارسال به داور) خیلی وقتها به همین متن بستگی داره.
اما چطور cover letter رو بنویسیم که در نگاه اول ریجکت نشه مقاله مون؟
## ۱. مقدمه؛ کوتاه و محترمانه
ادیتور باید در همان خط اول حس کنه با یک نویسنده حرفهای طرفه:
جملهی استاندارد: "Dear Dr. [Editor's Name], We are pleased to submit our manuscript entitled '…' for consideration in [Journal Name]."
⚠️ نکته: نام Editor-in-Chief رو از سایت ژورنال پیدا کنید و حتماً درست بنویسید.
## ۲. معرفی ارزش افزوده مقاله (Novelty Statement)
اینجا قلب Cover Letter است. باید در ۲–۳ جمله روشن کنید:
- چه مشکلی رو بررسی کردهاید؟
- چه شکاف علمی (Gap) رو پر میکنید؟
- چرا نتایج شما جدید و ارزشمند هستن؟
✍️ جملات قدرتمند:
- "To our knowledge, this is the first study to demonstrate..."
- "Our findings challenge the current understanding of..."
- "We provide novel evidence that..."
## ۳. ارتباط با حوزهی ژورنال + پیام کاربردی
دو هدف در یک پاراگراف:
- چرا این مقاله دقیقاً برای این ژورنال مناسبه
- خواننده چه چیزی یاد میگیره
🔬 برای علوم پزشکی: کاربرد بالقوه در تشخیص یا درمان
💻 برای بیوانفورماتیک: ابزار یا روشی که استفادهی عمومی داشته باشه
⚗️ برای علوم پایه: تأثیر بر فهم نظری موضوع
## ۴. Template عملی (۵ پاراگراف کوتاه)
Dear Dr. [Editor's Name],
We are pleased to submit our original research article entitled "[Title]" for consideration for publication in [Journal Name].
[2-3 جمله novelty]: Our study addresses... Unlike previous work... We demonstrate for the first time...
This work aligns with [Journal Name]'s focus on... and will be of interest to your readers because... [clinical/practical implications].
We confirm this manuscript is original, not published elsewhere, and follows all ethical guidelines. [اضافه کنید اگر موردی هست: IRB approval, conflict of interest]
Thank you for your consideration.
Sincerely,
[Corresponding Author Name & Affiliation]
## 🎯 اشتباهات پنهان در استفاده از BLAST که بیشتر دانشجوها خبر ندارن
Читать полностью…
## 🎯 چرا انتخاب cutoff برای p-value یا FDR میتونه کل نتایج رو عوض کنه؟
Читать полностью…
### 🎯 راهنمای عملی برای جویندگان بیوانفورماتیک
سلام دوست عزیز! 🧠
اگر از اون دسته افرادی هستی که به بیوانفورماتیک علاقهمند شدی و نمیدونی دقیقاً به کدوم سمت حرکت کنی، من میخوام در این پست و پستهای مشابه به سادهترین شکل ممکن راهنماییت کنم. پس لطفا برای بقیه دوستات بفرستش تا اونا هم یاد بگیرن و من هم تشویق بشم به ادامه.
---
۱. بزرگترین اشتباه در شروع: تلاش برای یادگیری بدون شناخت مسیر ❌
به احتمال زیاد فکر تو اینه: "خب، من باید اول Python یاد بگیرم، بعد R، بعد BLAST، بعد GROMACS و...". این رویکرد ابزار-محور، مثل اینه که برای نجار شدن، اول بری تمام ابزارهای نجاری رو بخری و سعی کنی کار با هر کدوم رو جداگانه یاد بگیری. بعد از چند ماه، تو شاید بدونی هر ابزار چه کار میکنه، اما هنوز هیچی نساختی!
این فرآیند خستهکننده است و چون هدف مشخصی نداری، انگیزهات رو از دست میدی.
بدتر از اون اینه که از این آموزش به اون دوره ی آنلاین و از این مقاله به اون کتاب میپری و باز هم میبینی هنوز نتونستی به خط فکری مشخصی برسی.
---
**۲. رویکرد استراتژیک: اجازه بده "سوال" راهنمای تو باشه ✅
رویکرد درست، رویکرد پروژه-محور هست. به جای آموزش بی هدف، با یک سوال علمی مشخص شروع کن. این سوال، تو رو مجبور میکنه که فقط همون ابزارهای لازم برای پاسخ به اون رو به صورت عمیق و عملی یاد بگیری.
در ادامه، یک گردش کار استراتژیک رو با هم میبینیم که به تو نشون میده چطور از یک سوال به ابزارهای درست برسی:
سوال ⬅️ فیلد اصلی ⬅️ زیرشاخهها ⬅️ تکنیکها ⬅️ ابزارها
شاید ندونی و یا میدونی که بیوانفورماتیک یه دنیای گسترده از علوم مختلفه که همگی دست به دست هم میدن تا با کامپیوتر و ریاضی و آمار به مسائل بیولوژیک بپردازن. بنابراین تفکیک این علوم و شاخه ها و زیرشاخه هاش به تو خیلی کمک میکنه.
بیا با دو مثال واقعی این مسیر رو با هم طی کنیم:
---
#### مثال ۱: دنیای ساختار و دارو
۱. سوال علمی:
"چطور داروی آسپرین باعث کاهش التهاب و درد میشه؟"
۲. فیلد اصلی:
این سوال در قلمرو طراحی دارو و بیولوژی ساختاری (Drug Design & Structural Biology) قرار میگیره.
۳. زیرشاخههای مرتبط:
برای پاسخ به این سوال، باید با این حوزهها آشنا بشی:
* بیولوژی ساختاری: درک شکل سهبعدی پروتئین هدف (آنزیم COX). (برو سراغ کتاب ها و مقالات این حوزه)
* داکینگ مولکولی: شبیهسازی نحوه اتصال آسپرین به پروتئین. (بعد از مطالعه در این حوزه، داکینگ رو یاد بگیر)
* شیمی محاسباتی: تحلیل برهمکنشهای شیمیایی بین دارو و هدف.
۴. تکنیکهای ضروری:
* بازیابی و آمادهسازی ساختار: پیدا کردن و "تمیز کردن" فایل PDB.
* بصریسازی مولکولی: دیدن و تحلیل ساختارها.
* تحلیل برهمکنش: شناسایی پیوندهای هیدروژنی و سایر نیروهای کلیدی.
۵. ابزارهای مورد نیاز:
* دیتابیس: PDB, UniProt, PubChem
* نرمافزارهای بصریسازی: UCSF ChimeraX, PyMOL
* نرمافزارهای داکینگ: AutoDock Vina, Schrödinger Suite
* ابزارهای تحلیل: PLIP, Discovery Studio Visualizer
---
#### مثال ۲: دنیای ژنوم و دادههای بزرگ
۱. سوال علمی:
"کدام ژنها در بیماران مبتلا به سرطان ریه نسبت به افراد سالم، فعالیت متفاوتی دارن؟"
۲. فیلد اصلی:
این سوال در قلمرو ژنومیکس عملکردی و تحلیل دادههای 'Omics قرار میگیره.
۳. زیرشاخههای مرتبط:
* ترانسکریپتومیکس: مطالعه بیان ژن از طریق دادههای RNA-seq.
* آمار زیستی: پیدا کردن تفاوتهای آماری معنادار.
* بیولوژی سیستمها: درک اینکه این ژنها در کدوم مسیرهای بیولوژیکی نقش دارن.
۴. تکنیکهای ضروری:
* بازیابی دادههای NGS: دانلود دادههای خام از دیتابیسهای عمومی.
* تحلیل بیان افتراقی (DGE): هسته اصلی تحلیل آماری.
* تحلیل غنیسازی مسیر (Pathway Enrichment): تفسیر بیولوژیکی لیست ژنها.
۵. ابزارهای مورد نیاز:
* دیتابیس: NCBI GEO, TCGA
* زبان برنامهنویسی: R (با پکیجهای DESeq2/edgeR) یا Python.
* ابزارهای تحلیل مسیر: Metascape, GSEA.
پس وظیفه ی تو اینه: اول سوالت رو تعیین کن، بعد ببین در کدوم زیرشاخه ی بیوانفورماتیک قرار میگیره، بعد مطالعات اون حوزه رو شروع کن، بعد تکنیک ها و ابزارها رو یاد بگیر.
حالا یه سوال توی کامنت ها بنویس تا با هم تحلیلش کنیم و بتونی راحتتر مسیرت رو پیدا کنی.
#بیوانفورماتیک #نقشه_راه #شروع_از_صفر #پروژه_محور #دانشجو #آموزش #بیوانفورشیمی
🆔
کانال بیوانفورشیمی
گروه بیوانفورشیمی
### 🎯 چطور از یک توالی DNA، ژنهای کدکننده پروتئین را پیدا کنیم؟
Читать полностью…
# 🚀 اتوماسیون دسترسی به دادهها با NCBI Entrez Direct
سلام و ادب خدمت همراهان عزیز 👋
امروز میخوام ابزار قدرتمندی رو باهاتون به اشتراک بذارم که کار دانلود دادهها از NCBI رو کاملاً متحول میکنه.
اگر تا الان برای دانلود توالیها از رابط گرافیکی استفاده میکردید، بعد از این پست دیگه به روش قدیمی برنمیگردید! 😎
---
فرض کنید برای یک تحلیل فیلوژنتیک به تمام توالیهای پروتئینی ژن TP53 در راسته پستانداران (Mammalia) نیاز دارید.
با رابط گرافیکی NCBI:
* ⏰ ساعتها وقت میبره
* ❌ احتمال خطا بالاست
* 📄 غیرقابل تکراره
* 🔗 در پایپلاینهای بزرگ استفاده نمیشه
---
## ⚙️ راهکار حرفهای: Entrez Direct
ابزار Entrez Direct مجموعه ابزارهای خط فرمان رسمی NCBI هست که اجازه جستجو و دانلود خودکار دادهها رو میده.
### 🏗 معماری پایه:
esearch → efetch
sh -c "$(curl -fsSL https://ftp.ncbi.nlm.nih.gov/entrez/entrezdirect/install-edirect.sh)"
export PATH=${PATH}:${HOME}/edirect
esearch -help
esearch -db nucleotide -query "NM_000546[Accession]" \
| efetch -format fasta
esearch -db nucleotide -query "TP53[Gene Name] AND human[Organism]" \
| efetch -format fasta > tp53_human.fasta
tp53_human.fasta ذخیره میکنه.esearch -db pubmed -query "TP53 AND breast cancer" \
| efetch -format abstract > tp53_breast_abstracts.txt
esearch -db protein -query "TP53[Gene Name] AND Mammalia[Organism] AND refseq[Filter]" \
| efetch -format fasta > tp53_mammals_refseq.fasta
esearch -db protein -query "TP53[Gene Name] AND Mammalia[Organism]" \
| xtract -pattern ENTREZ_DIRECT -element Count
esearch -db nucleotide -query "COX1[Gene Name] AND fish[Organism]" -retmax 50000 \
| efetch -format fasta > cox1_fish.fasta
📚بالاترین آمار قبولی ژنتیک پزشکی، ۳ سال پیاپی ۳ رتبه ۱ کشوری
@genemedia
هماتولوژی و ایمنی👇👇
@heamato
@abstract_of_immunology
@TAM_EdG
@hemato_case
@naderi_gp
@Dr_hematology
@immunotalk
@imonology_2022
@arshadphdimeni
@hematologyatlas
@IMMUNOLOGY_EDUCATION
@AmirrezaSafdarian
بیوشیمی و سلولی ، مولکولی👇👇
@BiochemistryK
@arabbioma2
@nemuneTadris7704
@DrNbiochemistry
@manafi_cell
@KazemzadehS
@biochemistry_p
@ChemistryKa
@bioinforchem
@bioteest
@Biomedicell
@Mj_mahdavi97
@molecularbiocell
@arabbioma
زبان و مهاجرت👇👇
@medicallanguage
@RezazadehEnglishGroup1400
@Class_Englysh
@dr_medicallanguage
@tarjjommee
@DR_MHLE_MSRT
@MAEAC
@Medical_English_academy
@zabanAbdollahpour
@Ellipsis50
@drmohajernia
ژنتیک 👇👇
@genemedia
@GeneticsAS
@medical_genetik
@medical_human_genetics
@Farahani_Genetics
@genetic_academic_lab
@basic_sciences_virtual_society
@Rotbebartara
@geneticmedical
قارچ،انگل،ویروس،باکتری👇👇
@behdashtparasit
@cafe_reghabat
@arshadbehdashtlab
@arshadmedicalmicrob
@Porsesh_Pasokh_Virology
@medical_virology_Dr_alborzi
@virology_moradi
پزشکی و دانشجویی👇👇
@lisans_be_pezeshkie
@Pishgam_Bioinformatics
@psarayedaneshjo
@guiton_97
@mindoka
@arshadphd
@taghz_2019
@RoyanEsfahan
@academic_science
فایل و کتاب،مشاوره👇👇
@PDFFILLE
@Manafi_Academy
@moshavere_group1403
@BrinsicaBooks
@KazemzadehT
@clipolumpezeshki
@biochemiaa
@hematologymoshaver
@culppezeshki2020
@kazemzadehM
@Manafi_Academy_group
@medbookkk
@ketabepezeshki2
@Farahani_Moshavereh
@basic_sciences_virtual_society
@Rotbebartara
@National_book
@ketabepezeshki
استخدامی ،آزمایشگاهی،جابه جای👇👇
@medjobpro
@laboratoryfellowship
@Azmonolompezshki
@EnteghaliOlompezeshki
@az_estekhdami
@Estekdamy
@Kadradarman
@dandanpzshke
@karyabeirn
@GroupEnteghaliOlompezeshki
@KazemzadehN
@Medical_Lab_Niazmandi_IRAN
@fellowship_lab
@labkaramouziii
@research_lab
@Lab_science
📚 هر #کتاب #جزوه و #ویدیو آموزشی از رشته های زیر میخواهید رایگان دانلد کنید 📍 کافیه روی رشته خود کلیک کنید 👇
/channel/addlist/tBmtF7WX-R85ZDQx
نسخه لوکال هدداک ورژن 2.5 برای داکینگ پروتئین-پروتئین/پپتید.
🆔
کانال بیوانفورشیمی
گروه بیوانفورشیمی
🧨📒📕 حاالا که مکانیسم ماشه فعال شده، در شرایط بد اقتصادی تورم هستیم،لزومی نداره کلی هزینه برای جزوه کلاس پرداخت کنید، برای کمک به دانشجویان عزیز جزوات و ویدیوهای آموزشی رشته های زیر را رایگان براتون امشب گذاشتیم، روی رشته خود کلیک کنید 👇
تایم استفاده از لینک زیر محدود هست....
چند وقت پیش یه مقاله دریافت کردم برای داوری. از ژورنال فاخر hazmat با ایمپکت فکتور ۱۱.۳
نویسندگان گرامی با روایتی نه چندان هوشمندانه استروژن رو به محیط زیست ربط داده بودن و یک کار تماما محاسباتی ارائه کرده بودند.
حداکثر تلاشم رو به کار گرفتم تا از بایاس به دور باشم و بیشترین زور حرفه ای گریم رو به اصطلاح بزنم تا داوری صادقانه ای ارائه بدم.
باور کنید هر چی زور زدم بی فایده بود. متودولوژی خیلی جای کار داشت. کانسپت مطالعه زیر سوال بود، جلوه محاسبات بیشتر از عمق و دقتشون خودنمایی میکردن. راستش رو بخواید اسکوپ ژورنال رو در خصوص این مقاله چکنکردم ولی هر چی بالا پایین میکردم راه امیدی برای اکسپت به شرط ماژور ریویژن ندیدم.
یکسری محاسبات کم وزن دنبال هم ردیف شده بودن تا بدون هر گونه تاییدیه آزمایشگاهی، ادعایی رو در ژورنالی وزین منتشر کنن.
با احترام و با توضیحات ۱۴ بندی نوشتم ریجکت.
یک ماه بعد ایمیل اومد فرست ریویژن. محاسبات قویتر شده بودن و انصافا تلاش خوبی صورت گرفته بود ولی همچنان ستونی زیر این کار نمیدیدم. هر چند که نباید کامنت جدیدی میدادم و به همین دلیل نوشتم نظر قبلیم پابرجاست.
جونم براتون بگه که در نهایت با ماینر ریویژن رفت برای بازبینی دوم و طبیعتا در آینده نزدیک اکسپت خواهد شد.
سطح داوران همکار هم در نوع خودشون جالب توجه بود. حتی یک نفر اشاره نکرده بود که بیخ و بن این کار ایراد داره. صرفا چنتا کامنت تکنیکال. ادیتور محترم هم به نظرات این عزیزان بسنده کردند.
خواستم بدونید که خودتونو دست کم نگیرید. خدا رو چه دیدید. شاید شما هم در آینده ی نزدیک یه کار این سیلیکو فرستادید نیچر و رفت داوری و پابلیشم شد.😁
برداشت شما چیه؟ تجربه ای داشتید؟ اصولا دنبال پابلیش باشیم فقط؟ یا یه ذره هم فلسفه ی علم بدونیم و بجوییم؟
🆔
کانال بیوانفورشیمی
گروه بیوانفورشیمی
ا## 🎯 Hidden Bias در دیتابیسهای بزرگ (مثل TCGA)
سلام به همه پژوهشگران نکتهسنج! 🧠
وقتی از دیتابیسهای بزرگ مثل TCGA، GEO/ENCODE، GTEx یا UK Biobank استفاده میکنیم، معمولاً خیالمون راحته که دادهها «استاندارد، کامل و قابل اعتماد» هستن. اما واقعیت اینه که این منابع هم پر از bias پنهان هستن که اگه حواسمون نباشه، کل نتیجهگیری اشتباه میشه.
---
ا### ۱. Bias جمعیتی (Population Bias)
* بیشتر دادههای TCGA از بیماران آمریکایی/اروپایی جمعآوری شدن
* نمایندگی جمعیتهای آسیایی، آفریقایی یا خاورمیانهای بسیار کمه
* نتیجه: یافتهها لزوماً قابل تعمیم به همه جمعیتها نیستن
---
ا### ۲. Bias مربوط به نوع نمونه (Sample Source Bias)
ا* بعضی cancer types تعداد زیادی نمونه دارن (مثل breast, lung)، بعضی دیگه خیلی محدودن
ا* Stage یا grade بیماری در گروهها یکسان نیست
ا* نتیجه: مقایسه مستقیم گمراهکننده میشه
---
ا### ۳. Batch Effect و Site Bias
* دادهها در مراکز مختلف با دستگاهها و پروتکلهای متفاوت تولید شدن
* نتیجه: ممکنه بهجای تفاوت بیولوژیک، تفاوت تکنیکی رو نشون بده
---
ا### ۴. Bias در دادههای کلینیکی
* اطلاعات بالینی بعضی بیماران ناقصه (age, survival, treatment)
* گاهی تعریف outcome بین cancer types متفاوت ثبت شده
* نتیجه: survival analysis بدون بررسی به نتایج غلط منجر میشه
---
ا### ۵. Bias انتخابی (Selection Bias)
* بیماران TCGA معمولاً مواردی بودن که tissue در دسترس بوده
* نتیجه: نمایندهی کل طیف بیماری نیستن (بیشتر از جراحی، کمتر از متاستاتیک پیشرفته)
---
ا### ۶. Bias زمانی (Temporal Bias)
* دادههای TCGA مربوط به دهه ۲۰۰۰ هستن
* درمانها و survival اون زمان با الان فرق میکنن
* نتیجه: مقایسه مستقیم با cohort جدید misleading است
---
ا### ۷. Bias در annotation ژنومی
* بعضی variants یا fusions در زمان جمعآوری هنوز ناشناخته بودن
ا* annotation اولیه ممکنه incomplete یا outdated باشه
---
## ✅ راهکارهای عملی کنترل Bias
۱. قبل از تحلیل:
ا- Batch correction انجام بشه (مثل ComBat یا limma)
ا- Re-annotation با دیتابیسهای جدید (gnomAD, COSMIC, Ensembl)
۲. حین تحلیل:
ا- Population stratification در نظر گرفته شه
ا- Sample size و demographic balance چک شه
ا- Missing data pattern بررسی شه
۳. بعد از تحلیل:
ا- Validation در cohort مستقل انجام شه
ا- Generalizability محدودیتها گزارش شه
---
## 🧩 جمعبندی
دیتابیسهایی مثل TCGA گنجینههای بینظیر هستن، اما بدون درک biasها، مثل نقشهای هستن که بخشی از مسیر رو نشون میده و بخشی رو مخفی میکنه. تحلیلگر حرفهای باید قبل از هر مدلسازی، اول سراغ کنترل و گزارش biasها بره.
#TCGA #Bias #BigData #CancerGenomics #بیوانفورماتیک #نکات_طلایی
🆔
کانال بیوانفورشیمی
گروه بیوانفورشیمی
## 🎯 اشتباهات پنهان در استفاده از BLAST که بیشتر دانشجوها خبر ندارن
سلام به همراهان بیوانفورشیمی! 🧬
خیلی وقتها اولین ابزاری که دانشجوها برای تحلیل توالی سراغش میرن، BLAST هست. اما پشت ظاهر سادهی این سرویس، نکات فنی زیادی وجود داره که اگه رعایت نشن، نتیجهی نهایی اشتباه میشه.
---
### ۱. قاطی کردن e-value با درصد شباهت
خیلیها فکر میکنن e-value پایینتر = شباهت بیشتر. در حالی که:
ا* e-value: احتمال اینکه این همترازی به صورت تصادفی رخ بده. به طول توالی و اندازه دیتابیس هم بستگی داره - همون alignment روی دیتابیس کوچکتر e-value بهتری خواهد داشت.
ا* % identity: درصد واقعی شباهت بین دو توالی در ناحیه همتراز شده.
⚠️ یک e-value کوچک، لزوماً به معنی شباهت بیولوژیکی معنادار نیست؛ مخصوصاً وقتی دیتابیس خیلی بزرگ باشه یا توالی کوتاه باشه.
---
### ۲. اشتباه در انتخاب دیتابیس
بعضیها همیشه روی nr (پروتئین) یا nt (نوکلئوتید) میزنن، بدون توجه به اینکه سوال تحقیقشون چی هست.
* دنبال ژنوم کامل هستید؟ → دیتابیس RefSeq Genomes بهتره.
* دنبال ژنهای annotated انسانی هستید؟ → RefSeq Human یا Ensembl مناسبترن.
* دنبال پروتئینهای تأیید شده هستید؟ → Swiss-Prot بهتر از nr هست.
* فقط روی یک گونه کار میکنید؟ → Taxonomic filtering استفاده کنید.
برای مقالات معتبر، همیشه دیتابیس انتخابی رو شفاف گزارش کنید.
---
### ۳. غفلت از Filtering و Masking
ا BLAST بهطور پیشفرض Low Complexity Regions رو ماسک میکنه (مثلاً تکرارهای ساده). بعضیها این گزینه رو خاموش میکنن چون فکر میکنن "همه اطلاعات لازمه".
✅ در حالی که روشن بودن این فیلتر جلوی false positiveهای زیاد رو میگیره.
⚠️ فقط زمانی ماسک رو خاموش کنید که دنبال repeat elementsها یا low complexity regionsها هستید.
---
### ۴. اشتباه در تفسیر طول همترازی (alignment length)
ممکنه %identity بالا باشه، ولی فقط روی ۳۰ اسیدآمینه از یک پروتئین ۴۰۰ تایی.
داورها معمولاً سریع گیر میدن: *"این همترازی معنیدار نیست چون پوشش (coverage) کافی نداره."*
✅ همیشه query coverage و subject coverage رو هم گزارش کنید.
مثال مناسب: 85% identity, 92% query coverage, e-value: 2e-45
---
### ۵. اتکا فقط به Top Hit
خیلیها اولین نتیجه رو برمیدارن و میگن "این ژن فلان پروتئینه".
در حالی که:
* ممکنه چند hit نزدیک با امتیاز مشابه وجود داشته باشه.
* باید ببینید annotation اونها چقدر معتبره (curated vs. predicted).
ا* اReciprocal BLAST انجام بدید: توالی پیدا شده رو دوباره BLAST کنید و ببینید آیا توالی اصلی رو پیدا میکنه یا نه.
---
### ۶. نادیده گرفتن پارامترهای جستجو
دانشجوها اغلب با تنظیمات پیشفرض کار میکنن، ولی:
* برای DNA: انتخاب BLASTn با word size کوچکتر برای حساسیت بیشتر.
* برای پروتئین: BLASTp یا PSI-BLAST بسته به هدف.
* برای homology دورتر: استفاده از matrix مناسب (مثلاً BLOSUM45 به جای BLOSUM62).
* برای توالیهای کوتاه: Short sequences algorithm فعال کنید.
---
### ۷. گزارش ناقص در مقاله
خیلیها فقط مینویسن: "توالی با BLAST بررسی شد."
ولی داورها انتظار دارن جزئیات کامل ببینن:
* نوع BLAST (BLASTn, BLASTp, BLASTx، یا PSI-BLAST)
* دیتابیس مورد استفاده و تاریخ دسترسی
* پارامترهای اصلی (e-value cutoff، word size، matrix)
* معیارهای انتخاب (minimum coverage، identity threshold)
---
## 📋 چکلیست ضروری BLAST
۱. ا e-value + %identity + coverage همزمان چک کن
۲. دیتابیس مناسب انتخاب کن
۳. ا Taxonomic filter اعمال کن (اگه لازمه)
۴. چند hit اول رو بررسی کن، نه فقط اولی
۵. ا Reciprocal BLAST انجام بده
۶. پارامترها رو مناسب تنظیم کن
۷. همه جزئیات رو در مقاله گزارش کن
---
#بلاست #بیوانفورماتیک #تحلیل_توالی #اشتباهات_پژوهشی #نکات_طلایی
🆔
کانال بیوانفورشیمی
گروه بیوانفورشیمی
## 🎯 چرا انتخاب cutoff برای p-value یا FDR میتونه کل نتایج رو عوض کنه؟
یکی از موضوعات مهم توی تحلیل دادههای زیستی ـ مخصوصاً وقتی با دادههای بزرگ مثل RNA-seq یا GWAS سروکار داریم ـ بحث انتخاب آستانه (cutoff) برای آزمونهای آماریه. همین انتخاب ساده میتونه کاری کنه که برداشت ما از دادهها کاملاً متفاوت بشه.
---
### ۱. فرق p-value با adjusted p-value (یا q-value)
ا* p-value (خام): احتمال اینه که نتیجهای که دیدیم، فقط به خاطر شانس باشه.
ا* مشکل: وقتی هزاران تست انجام میدیم، حتی اگه هیچ اثر واقعی نباشه، کلی نتیجهی «معنادار» ظاهر میشه (مشکل *multiple testing*).
ا*adjusted p-value یا q-value: نسخهی اصلاحشدهی همون p-value ـ بعد از اینکه خطای چندتایی رو حساب کردیم. روشهای رایجش:
ا* Bonferroni correction: خیلی سختگیرانه، خطای نوع اول رو تقریباً صفر میکنه، ولی خیلی از نتایج واقعی رو هم حذف میکنه.
ا * Benjamini–Hochberg (FDR): یه تعادل ایجاد میکنه؛ رایجترین روش تو مطالعات omics.
* روشهای دیگه مثل Holm یا BY هم هستن که بسته به شرایط استفاده میشن.
---
### ۲. چرا cutoff اینقدر تعیینکنندهست؟
مثال: آنالیز RNA-seq روی ۲۰٬۰۰۰ ژن:
ا* p < 0.05 (خام): حدود ۱۵۰۰ ژن معنادار میشه.
ا* FDR < 0.05: فقط ۹۵ ژن باقی میمونه.
ا* FDR < 0.1: نزدیک ۲۸۰ ژن.
ا* Bonferroni < 0.05: تنها ۲۳ ژن!
یعنی همون داده، بسته به آستانه، میتونه چهار تصویر کاملاً متفاوت بده.
---
### ۳. انتخاب آستانه متناسب با نوع مطالعه
* مطالعات اکتشافی (Exploratory): وقتی دنبال فرضیهسازی هستیم → میشه cutoff رو یه کم شلتر گرفت (مثلاً FDR < 0.1).
* مطالعات تأییدی/بالینی: وقتی میخوایم نتیجه رو بهعنوان شواهد قطعی نشون بدیم → باید خیلی سختگیر باشیم (FDR < 0.01 یا حتی Bonferroni).
* روش ترکیبی: خیلی وقتها مقالههای خوب هر دو رو گزارش میکنن.
«از بین ۳۲۱ ژن با p < 0.05، تعداد ۴۸ ژن بعد از اصلاح چندگانه (FDR < 0.05) همچنان معنادار باقی موندن.»
---
### ۴. توصیههای کاربردی برای گزارش
1. اسم روش اصلاح رو دقیق بگید. فقط نوشتن FDR کافی نیست.
2. مقدار دقیق رو گزارش کنید. مثلاً "q = 0.034" بهتر از اینه که فقط بگید "معناداره".
3. نمایش تصویری بذارید. مثل Volcano Plot که هم p-value خام رو نشون بده و هم q-value.
4. به اهمیت زیستی و اندازه اثر (effect size) هم فکر کنید. گاهی ژنی با q = 0.06 از نظر آماری لب مرزه، ولی توی یه مسیر حیاتی (مثلاً p53) هست و fold change بالایی داره.
5. پایداری نتایج مهمه. اگه یه یافته فقط با یه cutoff خاص ظاهر بشه و با بقیه ناپدید بشه، داورها بهش اعتماد نمیکنن.
---
### 🧩 جمعبندی
انتخاب cutoff برای p-value یا FDR فقط یه تصمیم تکنیکی نیست؛ بلکه میتونه کل داستان مقاله رو تغییر بده. برای همین:
* هم p-value خام و هم مقادیر اصلاحشده رو گزارش کنید،
* روش اصلاح رو شفاف بگید،
* و حتماً نتایج رو در چارچوب زیستی تفسیر کنید.
---
شما توی کاراتون بیشتر بر اساس p-value خام گزارش میکنید یا FDR/q-value؟ 📌
تا حالا پیش اومده تغییر cutoff کل نتایج مقاله یا پایاننامهتون رو زیر و رو کنه؟
---
#آمار #FDR #pvalue #qvalue #MultipleTesting #RNAseq #Bioinformatics #DataAnalysis
🆔
کانال بیوانفورشیمی
گروه بیوانفورشیمی
📚 به مناسبت #روز_پزشک جزوات رشته های زیر را به صورت رایگان در کانالها گذاشته میشه، عضویت کاملا محـدود
/channel/addlist/aLRMNvUnk3hmODVh
### 🎯 چطور از یک توالی DNA، ژنهای کدکننده پروتئین را پیدا کنیم؟
سلام عزیزان! 🧬
فرض کنید یه ژنوم کامل با میلیاردها حرف (A, C, G, T) جلوی روی شماست. متنی عظیم که هیچ فاصلهای بین کلماتش نیست. سؤال کلیدی اینه: چطور میفهمیم کدوم بخش این متن در واقع یک ژن واقعی هست که پروتئین میسازه؟
---
۱. زبان سلول: سیگنالهای شروع و پایان
سلول برای راهنمایی ریبوزوم، نشانههای مشخصی در توالی قرار داده:
* 🚦 Start Codon (ATG): نقطه شروع ترجمه، که متیونین رو کد میکنه.
* 🛑 Stop Codons (TAA, TAG, TGA): جایی که باید ایست کرد.
هر بخش از DNA که از ATG شروع و با یکی از این توقفها تمام بشه، یک کاندید جدی برای ژن محسوب میشه.
---
۲. مفهوم طلایی: ORF یا Open Reading Frame
یک ORF یعنی ناحیهای که:
✅ با ATG شروع بشه.
✅ با یکی از Stop Codonها پایان پیدا کنه.
✅ وسط راه هم هیچ توقف دیگری نداشته باشه.
این ORFها همون «جملات معنادار» DNA هستن.
---
۳. پیچیدگی واقعی: شش فریم خوانش
چون DNA دو رشتهایه و هر رشته رو میشه از سه نقطه مختلف خوند، در مجموع شش Reading Frame داریم. پس باید همه رو بررسی کنیم تا ORFها رو از دست ندیم.
---
۴. ابزارهای جستجوی ORF
🔹 اول NCBI ORFfinder: سادهترین روش. توالی رو وارد کن، روی Submit بزن، و ORFها رو روی یک نقشه گرافیکی ببین.
🔹دوم پایتون برای حرفهایها:
def find_orfs(sequence):
stop_codons = ["TAA", "TAG", "TGA"]
orfs = []
for i in range(len(sequence)):
if sequence[i:i+3] == "ATG":
for j in range(i+3, len(sequence), 3):
if sequence[j:j+3] in stop_codons:
orfs.append(sequence[i:j+3])
break
return orfs
dna = "AGCCATGTAGCTAACTCAGGTTACATGGGGATGACCCCGCGACTTGGATTAGAGTCTCTTTTGGAATAAGCCTAG"
for orf in find_orfs(dna):
print(f"ORF Found: {orf} (Length: {len(orf)})")
این پست بهطور خاص برای این دسته از افراد خیلی بهدردبخوره:
* پژوهشگرانی که تحلیل فیلوژنتیک انجام میدن
مثلا کسی که میخواد تمام توالیهای یک ژن (مثل *COX1* یا *TP53*) رو از چندین گونه جمعآوری کنه تا درخت فیلوژنتیک بسازه.
* محققان پروژههای ژنومیک و ترنسکریپتومیک
مثلا در RNA-seq نیاز دارن همه توالیهای مرجع یک ژن یا خانواده ژنی رو از NCBI بهصورت یکجا بگیرن.
* کاربرانی که با دادههای RefSeq یا GenBank زیاد کار میکنن
مثلاً برای بررسی تنوع پروتئینی یک ژن در بین گونهها.
* زیستاطلاعرسانها و برنامهنویسان پایپلاین
افرادی که میخوان دانلود داده رو داخل یک اسکریپت خودکار یا آنالیز pipeline ادغام کنن.
* کسانی که مرور سیستماتیک یا متاآنالیز دادههای توالی انجام میدن
مثل کسی که میخواد تمام دادههای یک ژن یا پروتئین رو جمعآوری کنه و ویژگیهای ساختاری/تکاملی اون رو بررسی کنه.
# 🚀 اتوماسیون دسترسی به دادهها با NCBI Entrez Direct
Читать полностью…