Araştırma Makalesi

Görme engelliler için nesne tanıma ve resim altyazısını derin öğrenme teknikleriyle entegre eden verimli bir aktivite tanıma modeli

Cilt: 39 Sayı: 4 20 Mayıs 2024
PDF İndir
TR

Görme engelliler için nesne tanıma ve resim altyazısını derin öğrenme teknikleriyle entegre eden verimli bir aktivite tanıma modeli

Öz

Bir görüntünün içeriğini otomatik olarak tanımlamak, bilgisayarla görmeyi ve doğal dil işlemeyi birbirine bağlayan yapay zekadaki temel bir görevdir. Bu çalışmada, bilgisayarla görü ve makine çevirisindeki son gelişmeleri birleştiren ve bir görüntüyü tanımlayan doğal cümleler oluşturmak için derin ve tekrarlayan bir mimariye dayalı üretken bir model sunulmuştur. Oluşturulan bu model ile görüntülerden elde edilen metinler, ses dosyası formatına dönüştürülebilmekte ve görme engelli insanlar için kişinin etrafında bulunan nesnelerin aktivitesi tanımlanabilmektedir. Bu amaçla, ilk olarak, belirli bir görüntüdeki bir veya daha fazla nesnenin varlığını, konumunu ve türünü tanımlayan YOLO modeliyle görüntüler üzerinde nesne tanıma işlemi gerçekleştirilmiştir. Sonrasında, uzun kısa dönem hafıza ağları (LSTM) eğitim görüntüsü verilen hedef açıklama cümlesinin olasılığını en üst düzeye çıkarmak için eğitilmiştir. Böylece, ilgili görüntü içerisinde yer alan aktiviteler, açıklama olarak metin biçimine dönüştürülmüştür. Metin biçimine dönüştürülen aktiviteler, Google metin okuma platformundan faydalanılarak aktiviteyi tanımlayan ses dosyaları elde edilmiştir. Önerilen modelin etkinliğini göstermek amacıyla dört farklı özellik enjeksiyon mimarisi değerlendirilerek Flickr8K, Flickr30K ve MSCOCO veri kümeleri kullanılmıştır. Deney sonuçları, önerdiğimiz modelin görme engelli bireyler için aktivite tanımlamayı sesli olarak ifade etmede başarılı olduğunu göstermiştir.

Anahtar Kelimeler

Kaynakça

  1. 1. Hossain M.Z., Sohel F., Shiratuddin M.F., Laga, H., A comprehensive survey of deep learning for image captioning, ACM Computing Surveys 51 (6), 1-36, 2019.
  2. 2. Yao T., Pan Y., Li Y., Qiu Z., Mei T., Boosting image captioning with attributes, IEEE International Conference on Computer Vision, Venice, Italia, 4894-4902, 22-29 Ekim, 2017.
  3. 3. You Q., Jin H., Wang Z., Fang C., Luo J., Image captioning with semantic attention, IEEE Conference on Computer Vision And Pattern Recognition, Las Vegas, USA, 4651-4659, 26 Haziran-1 Temmuz, 2016.
  4. 4. Pan J.Y., Yang H.J., Duygulu P., Faloutsos C., Automatic image captioning, IEEE International Conference on Multimedia and Expo, Taipei, Taiwan, 1987-1990, 27-30 Haziran, 2004.
  5. 5. O'Shea K. ve Nash R. An introduction to convolutional neural networks. https://arxiv.org/abs/1511.08458. Aralık 2, 2015. Temmuz 30, 2019.
  6. 6. Medsker L.R. ve Jain L.C., Recurrent neural networks, Design and Applications, 5, 64-67, 2001.
  7. 7. Hochreiter S. ve Schmidhuber J., Long short-term memory, Neural Computation, 9 (8), 1735-1780, 1997. 8. Montavon G., Samek W., Müller K.R., Methods for interpreting and understanding deep neural networks, Digital Signal Processing, 73, 1-15, 2018.
  8. 9. Guo T., Dong J., Li H., Gao Y., Simple convolutional neural network on image classification. IEEE International Conference on Big Data Analysis, Beijing, China, 721-724, 10-12 Mart, 2017.

Ayrıntılar

Birincil Dil

Türkçe

Konular

Mühendislik

Bölüm

Araştırma Makalesi

Erken Görünüm Tarihi

17 Mayıs 2024

Yayımlanma Tarihi

20 Mayıs 2024

Gönderilme Tarihi

31 Ocak 2023

Kabul Tarihi

17 Eylül 2023

Yayımlandığı Sayı

Yıl 2024 Cilt: 39 Sayı: 4

Kaynak Göster

APA
Kilimci, Z. H., & Küçükmanisa, A. (2024). Görme engelliler için nesne tanıma ve resim altyazısını derin öğrenme teknikleriyle entegre eden verimli bir aktivite tanıma modeli. Gazi Üniversitesi Mühendislik Mimarlık Fakültesi Dergisi, 39(4), 2177-2186. https://doi.org/10.17341/gazimmfd.1245400
AMA
1.Kilimci ZH, Küçükmanisa A. Görme engelliler için nesne tanıma ve resim altyazısını derin öğrenme teknikleriyle entegre eden verimli bir aktivite tanıma modeli. GUMMFD. 2024;39(4):2177-2186. doi:10.17341/gazimmfd.1245400
Chicago
Kilimci, Zeynep Hilal, ve Ayhan Küçükmanisa. 2024. “Görme engelliler için nesne tanıma ve resim altyazısını derin öğrenme teknikleriyle entegre eden verimli bir aktivite tanıma modeli”. Gazi Üniversitesi Mühendislik Mimarlık Fakültesi Dergisi 39 (4): 2177-86. https://doi.org/10.17341/gazimmfd.1245400.
EndNote
Kilimci ZH, Küçükmanisa A (01 Mayıs 2024) Görme engelliler için nesne tanıma ve resim altyazısını derin öğrenme teknikleriyle entegre eden verimli bir aktivite tanıma modeli. Gazi Üniversitesi Mühendislik Mimarlık Fakültesi Dergisi 39 4 2177–2186.
IEEE
[1]Z. H. Kilimci ve A. Küçükmanisa, “Görme engelliler için nesne tanıma ve resim altyazısını derin öğrenme teknikleriyle entegre eden verimli bir aktivite tanıma modeli”, GUMMFD, c. 39, sy 4, ss. 2177–2186, May. 2024, doi: 10.17341/gazimmfd.1245400.
ISNAD
Kilimci, Zeynep Hilal - Küçükmanisa, Ayhan. “Görme engelliler için nesne tanıma ve resim altyazısını derin öğrenme teknikleriyle entegre eden verimli bir aktivite tanıma modeli”. Gazi Üniversitesi Mühendislik Mimarlık Fakültesi Dergisi 39/4 (01 Mayıs 2024): 2177-2186. https://doi.org/10.17341/gazimmfd.1245400.
JAMA
1.Kilimci ZH, Küçükmanisa A. Görme engelliler için nesne tanıma ve resim altyazısını derin öğrenme teknikleriyle entegre eden verimli bir aktivite tanıma modeli. GUMMFD. 2024;39:2177–2186.
MLA
Kilimci, Zeynep Hilal, ve Ayhan Küçükmanisa. “Görme engelliler için nesne tanıma ve resim altyazısını derin öğrenme teknikleriyle entegre eden verimli bir aktivite tanıma modeli”. Gazi Üniversitesi Mühendislik Mimarlık Fakültesi Dergisi, c. 39, sy 4, Mayıs 2024, ss. 2177-86, doi:10.17341/gazimmfd.1245400.
Vancouver
1.Zeynep Hilal Kilimci, Ayhan Küçükmanisa. Görme engelliler için nesne tanıma ve resim altyazısını derin öğrenme teknikleriyle entegre eden verimli bir aktivite tanıma modeli. GUMMFD. 01 Mayıs 2024;39(4):2177-86. doi:10.17341/gazimmfd.1245400