DataGrid Architecture
Download
Report
Transcript DataGrid Architecture
Cоздание российского сегмента
европейской инфраструктуры EU
DataGRID
Ильин В.А. (НИИЯФ МГУ),
Кореньков В.В. (ОИЯИ)
4 Всероссийская конференция RCDL 2002
«Электронные библиотеки: перспективные
методы и технологии, электронные
коллекции»
Дубна, 16 октября 2002 года
Five Emerging Models of Networked
Computing From The Grid
• Distributed Computing
– || synchronous processing
• High-Throughput Computing
– || asynchronous processing
• On-Demand Computing
– || dynamic resources
• Data-Intensive Computing
– || databases
• Collaborative Computing
– || scientists
Ian Foster and Carl Kesselman, editors, “The Grid: Blueprint for a New Computing
Infrastructure,” Morgan Kaufmann, 1999, http://www.mkp.com/grids
The Anatomy of the Grid: Enabling Scalable Virtual Organizations,
I. Foster, C. Kesselman, S. Tuecke, Intl J. Supercomputer Applns,
2001. www.globus.org/research/papers/anatomy.pdf
The Globus Team:Layered Grid Architecture
“Coordinating multiple resources”:
ubiquitous infrastructure services,
app-specific distributed services
“Sharing single resources”:
negotiating access, controlling use
Collective
Application
Resource
“Talking to things”: communication
(Internet protocols) & security
Connectivity
Transport
Internet
“Controlling things locally”: Access
to, & control of, resources
Fabric
Link
Internet Protocol Architecture
Application
CERN
LHC in the LEP Tunnel
Counter circulating
beams of protons in the
same beampipe.
Centre of mass
collision energy of 14
TeV.
1000 superconducting
bending magnets, each 13
metres long, field 8.4
Tesla.
Super-fluid Helium
cooled to 1.90 K
World’s largest superconducting structure
The LHC detectors
CMS
ATLAS
3.5 Petabytes/year 109 events/year
LHCb
Событие в LHC
Online system
• Multi-level trigger
• Filter out background
• Reduce data volume
• Online reduction 107
• Trigger menus
• Select interesting events
• Filter out less interesting
LHC Challenges: Scale
• Data written to tape ~5 Petabytes/Year and UP
(1 PB = 10**9 MBytes)
• Processing capacity 100 - TIPS and UP
(1 TIPS = 10**6 MIPS)
• Typical networks 0.5 - Few Gbps Per Link
• Lifetime of experiment 2-3 Decades
• Users ~ 5000 physicists
• Software developers ~ 300 (Four Experiments)
Требуемые скорости коммуникаций в структуре региональных центров для LHC
Generic model of a Fabric (computing farm)
local network servers
to external network
application servers
tape servers
disk servers
Storage
Network
Computing fabric
at CERN (2005)
12
Thousands of CPU boxes
1.5
0.8
8
6*
24 *
Farm Network
Hundreds of
tape drives
0.8
0.8
Real-time
detector data
* Data Rate
in Gbps
250
5
960 *
LAN-WAN Routers
Storage Network
Thousands of disks
StarLight: The Optical STAR
TAP
SURF
net
STAR TAP
AADS
ATM
UIC
BN
Star
Light
Purdue
GigE
NU
Evanston
iCAIR
IUPUI
NU
Chicago
GigE
ANL
IU
CERN
I-WIRE
& Optical
MREN
UIUC
UC
CA*net4
Bell Nexxia
(Chicago)
Bloomington
?
This diagram subject to change
DataTAG project
NewYork
Abilene
UK
SuperJANET4
It
GARR-B
STAR-LIGHT
ESNET
Geneva
GEANT
MREN
NL
SURFnet
STAR-TAP
Name
Некоторые Grid Проекты
URL/Spons
Focus
or
European Union
(EU) DataGrid
www.eudatagrid.org
European Union
Создание реальной Grid для
различных приложений в области
Физики Высоких Энергий,
Биоинформатики и ООС.
EU DataTAG
Project
www.datatag.org
Interoperability between European
and US Grids
CrossGrid
European Union
EuroGrid, Grid
Interoperability
(GRIP)
www.eurogrid.org Создание технологий для удалённого
European Union доступа к суперкомпьютерам и их
приложениям
Globus Project™
globus.org
DARPA, DOE,
NSF, NASA,
Msoft
Исследование в области Grid
технологий; создание и тех.
поддержка Globus Toolkit™;
приложения.
GridPP
gridpp.ac.uk
Создание реальной Grid в Англии
Некоторые Grid Проекты
Name
URL/Spon
sor
Focus
Grid Physics
Network
griphyn.org
NSF
Cоздание технологий для анализа
данных в физике: ATLAS, CMS,
LIGO, SDSS
International Virtual
Data Grid
Laboratory
ivdgl.org
NSF
Создание реальной международной
Grid для экспериментов над Grid
технологиями и приложениями
TeraGrid
teragrid.org
NSF
Научная инфраструктура в США,
связывающая 4 организации 40
Gb/s
Particle Physics
Data Grid
ppdg.net
DOE Science
Создание реальной Grid для
анализа данных в Физике Высоких
Энергий и Ядерной физике
EDG overview :
structure , work packages
The EDG collaboration is structured in 12 Work Packages
WP1: Work Load Management System
WP2: Data Management
WP3: Grid Monitoring / Grid Information Systems
WP4: Fabric Management
WP5: Storage Element
WP6: Testbed and demonstrators
WP7: Network Monitoring
WP8: High Energy Physics Applications
WP9: Earth Observation
WP10: Biology
WP11: Dissemination
WP12: Management
}
Applications
EDG middleware architecture
Globus hourglass
• Current EDG architectural functional blocks:
– Basic Services ( authentication, authorization,
Replica Catalog,
secure file transfer,Info
Providers) rely on Globus 2.0
(GSI, GRIS/GIIS,GRAM, MDS)
Specific
application layer
VO common
application
layer
GRID
middleware
GLOBUS
2.0
ALICE
ATLAS
LHC
CMS
LHCb
Other apps
Other apps
High level GRID
middleware
Basic Services
OS & Net services
DataGrid Architecture
Local Computing
Grid
Local Application
Local Database
Grid Application Layer
Data
Management
Job
Management
Metadata
Management
Object to
File Mapping
Collective Services
Information
& Monitoring
Replica
Manager
Grid
Scheduler
Underlying Grid Services
Database
Services
Computing
Element
Services
Storage
Element
Services
Replica
Catalog
Authorization
Authentication
& Accounting
Logging &
Bookkeeping
Grid
Fabric
Fabric services
Resource
Management
Configuration
Management
Monitoring
and Fault
Tolerance
Node
Installation &
Management
Fabric Storage
Management
EDG middleware
architecture: EDG interfaces
Local
Application
Application
Developers
System
Managers
Grid Application Layer
Data
Job
Managem.
Managem.
Local Database
Scientists
Object to
File Map
Metadata
Managem.
Certificate
Authorities
Collective Services
Grid
Scheduler
File
Systems
Replica
Manager
Underlying Grid Services
SQL
Computing
Database
Element
Services
Services
Storage
Element
Services
Operating System Fabric services
Resource
Managem.
Config
Managem.
Info &
Monitor
Replica
Catalog
Monitoring
Fault
Tolerance
Authorization
Authentication
Accounting
Node
Installation
Managem.
Logging &
Bookkeeping
Fabric
Storage
Managem.
User Accounts
Batch Systems
Mass Storage Systems
HPSS, Castor
Storage
Elements
Computing Elements
The Workload Management System
(WP1)
• WP1 is responsible for the Workload Management System
(WMS).
The WMS is currently composed by the following parts:
– User Interface (UI) : access point for the user to the
GRID
( using JDL)
– Resource Broker (RB) : the broker of GRID resources,
matchmaking
– Job Submission System (JSS) : Condor-G; interfacing
batch systems
– Information Index (II) : an LDAP server used as a filter to
select resources
– Logging and Bookkeeping services (LB) : MySQL
databases to store Job Info
WP1: Work Load
Management
Local Application
Grid Application Layer
Job
Managem.
Components
Job Description Language
Grid
Scheduler
SQL
Database
Services
User Interface
UI : python (LB client : C++)
RB : C++
JSS : C++, python
II : LDAP server
LB: MySQL, C++
Input/Output Sandboxes: GridFTP
Object to
File
Mapping
Replica
Manager
Info &
Monitor
Computing
Element
Services
Storage
Element
Services
Replica
Catalog
Authorization
Authentication
Accounting
Logging &
Bookkeeping
Fabric services
Resource
Managem.
Implementation:
Metadata
Managem.
Underlying Grid Services
Information Index
Logging & Bookkeeping Service
Data
Managem.
Collective Services
Resource Broker
Job Submission Service
Local Database
Config
Management
Monitoring
Fault
Tolerance
Node
Installation
Management
Fabric Storage
Management
WMS main interfaces:
Globus Gatekeeper
WP2 Replica Catalog APIs
WP3 Information Systems
WP7 network monitoring info providers
End User (using JDL files, on the UI)
WP2: Data
Management
Local Application
Grid Application Layer
Job
Managem.
Deployed Components
GridFTP
Grid
Scheduler
SQL
Database
Services
Object to
File
Mapping
Replica
Manager
Info &
Monitor
Computing
Element
Services
Storage
Element
Services
Replica
Catalog
Authorization
Authentication
Accounting
Logging &
Bookkeeping
Fabric services
Resource
Managem.
Metadata
Managem.
Underlying Grid Services
GDMP
Spitfire
Data
Managem.
Collective Services
Replica Manager - edg-replicamanager
Replica Catalog - globus-replicacatalog
Local Database
Config
Management
Monitoring
Fault
Tolerance
Node
Installation
Management
Fabric Storage
Management
Implementation:
RM: C++ classes (under
development)
RC : Globus Replica Catalog wrapper
GDMP : C++
Spitfire : Java, Web Services
WP2 main interfaces:
The GRID Storage Element
WP1 Resource Broker APIs
WP3 GRID Info services
WP7 network monitoring info providers
End User (using GDMP)
WP2 next generation
Replication Services
Reptor
Replica Manager
Optimization
Optor
Client
Transaction
Consistency
Postprocessing
File Transfer
Preprocessing
Replica Location
Subscription
GDMP
Giggle
Replica Metadata RepMeC
Replication Services Architecture
User Interface
Replica
Replica
Replica
Location
Location
Location
Index
Index
Index
Replica
Metadata Catalog
Resource Broker
Site
Core API
Site
Replica Manager
Optimisation API
Optimiser
Processing API
Pre-/Postprocessing
Computing
Element
Local
Replica
Catalog
Replica Manager
Optimiser
Local
Replica
Catalog
Pre-/Postprocessing
Storage
Element
Computing
Element
Storage
Element
The SE architecture
Clients
CLIs)
( RB,JSS, RM, GDMP, InfoServices(WP3),User Applic running on CEs,
Top
layer
Interface
1
Interface
2
Session Manager
Core
MetaData
Message Queue
System Log
Bottom
layer
Interface
3
House Keeping
MSS
Interface
MSS
Interface
MSS1
MSS2
Storage
Element
DataGrid Architecture
Local Computing
Grid
Local Application
Local Database
Grid Application Layer
Data
Management
Job
Management
Metadata
Management
Object to
File Mapping
Collective Services
Information
& Monitoring
Replica
Manager
Grid
Scheduler
Underlying Grid Services
Database
Services
Computing
Element
Services
Storage
Element
Services
Replica
Catalog
Authorization
Authentication
& Accounting
Logging &
Bookkeeping
Grid
Fabric
Fabric services
Resource
Management
Configuration
Management
Monitoring
and Fault
Tolerance
Node
Installation &
Management
Fabric Storage
Management
Comment: some servers and services are under construction
Освоена технология создания информационных серверов
GIIS, собирающих информацию о локальных вычислительных
ресурсах и
ресурсов по хранению данных (создаваемых
GLOBUS службой GRIS на каждом узле распределенной
системы) и передающих эту информацию в динамическом
режиме в вышестоящий сервер GIIS. Таким образом, освоена и
протестирована
иерархическая
структура
построения
информационной службы GRIS-GIIS. Организован общий
информационный сервер GIIS
(ldap://lhc-fs.sinp.msu.ru:2137), который передает информацию
о
локальных
ресурсах
российских
институтов
на
информационный сервер GIIS (ldap://testbed1.cern.ch:2137)
европейского проекта EU DataGRID.
Russian National GIIS
dc=ru, o=grid
Country-level GIIS
lhc-fs.sinp.msu.ru:2137
CERN Top-level
WP6 GIIS
testbed001.cern.ch:2137
dc=sinp, dc=ru, o=grid
SINP MSU, Moscow
dc=jinr, dc=ru, o=grid
JINR, Dubna
dc=srcc, dc=ru, o=grid
SRCC MSU, Moscow
dc=ihep, dc=ru, o=grid
IHEP, Protvino
dc=itep, dc=ru, o=grid
ITEP, Moscow
dc=tcss, dc=ru, o=grid
TCSS, Moscow
dc=kiam, dc=ru, o=grid
KIAM, Moscow
dc=?, dc=ru, o=grid
St. Petersburg
SRCC MSU, KIAM and TCSS participate only in Russian DataGrid project and are
not involved in CERN projects.
В НИИЯФ МГУ создан Сертификационный центр
(Certification authority, СА) для российского сегмента.
Сертификаты
этого
центра
принимаются
всеми
участниками европейского проекта EU DataGRID.
Разработана схема подтверждения запросов на
сертификаты с помощью расположенных в
других
организациях Регистрационных центров (Registration
authority, RC), заверяющих запросы пользователей
электронной подписью с помощью сертификата GRID.
Разработаны программы постановки и проверки
электронной подписи, а также пакет программ для
автоматизации работы Сертификационного центра.
Предложенная схема CA+RC и пакет программ
приняты в ЦЕРНе и других участниках европейского
проекта EU DataGRID.
Инсталлирована и протестирована программа репликации файлов и
баз данных GDMP (GRID Data Mirroring Package), которая создана для
выполнения удаленных операций с распределенными базами данных.
Она использует сертификаты GRID и работает по схеме клиент-сервер,
т.е. репликация изменений в базе данных происходит в динамическом
режиме. Сервер периодически оповещает клиентов об изменениях в базе,
а клиенты пересылают обновленные файлы с помощью команды GSIftp. Текущая версия GDMP работает с объектно-ориентированнной базой
данных Objectivity DB, а также создается версия с динамической
репликацией обычных файлов.
Программа GDMP активно используется для репликации в ЦЕРН
распределенной базы смоделированных данных, создаваемой в ОИЯИ
(Дубна), НИИЯФ МГУ и других институтах по физике высоких энергий
для эксперимента LHC-CMS.
Программа GDMP рассматривается в качестве GRID стандарта для
репликации изменений в распределенных базах данных.
В ОИЯИ выполнен комплекс работ по мониторингу сетевых ресурсов,
узлов, сервисов и приложений. Сотрудники ОИЯИ принимают участие в
развитии средств мониторинга для вычислительных кластеров с очень
большим количеством узлов (10.000 и более), используемых в создаваемой
инфраструктуре EU DataGRID.
В рамках задачи Monitoring and Fault Tolerance (Мониторинг и
устойчивость при сбоях) они участвуют в создании системы корреляции
событий (Correlation Engine). Задача этой системы - своевременное
обнаружение аномальных состояний на узлах кластера и принятие мер по
предупреждению сбоев.
С помощью созданного прототипа Системы корреляции событий
(Correlation Engine) ведется сбор статистики аномальных состояний узлов на
базе вычислительных кластеров ЦЕРН. Производится анализ полученных
данных для выявления причин сбоев узлов. На втором этапе предусмотрено
расширение прототипа Correlation Engine с учетом полученных результатов
и испытание системы автоматизированного предупреждения сбоев на
практике.
Этот прототип установлен на вычислительных кластерах в ЦЕРН и
ОИЯИ, где производится сбор статистики аномальных состояний узлов.
В сотрудничестве с Институтом прикладной
математики имени M.И. Келдыша программа
Metadispetcher установлена в российском сегменте
инфраструктуры EU DataGRID.
Программа Metadispetcher предназначена для
планирования
запуска
заданий
в
среде
распределенных компьютерных ресурсов типа
GRID.
Было
проведено
ее
тестирование,
по
результатам
которого
программа
была
доработана для обеспечения эффективной
передачи данных средствами GLOBUS.
Задача массовой генерации
событий для CMS на LHC
PYTHIA
NTPL
GEANT3
FZ
ORCA
ooHITS
data_set_1
Objy/DB
data_set_2
PYTHIA
NTPL
GEANT3
FZ
ORCA
ooHITS
signal
Objy/DB
ROOT,
NTPL
ORCA
user
analysis
Objy/DB
ORCA
digis
pile up
Задача массовой генерации
событий для CMS на LHC (как это было)
RefDB at
CERN
IMPALA
jobs
UI
UI
BOSS
mySQL DB
batch manager
N1
Environment
N2
GK
NFS
Nn
job executer
CMKIN
Задача массовой генерации
событий для CMS на LHC (предложенное
решение)
RefDB at
CERN
DOLLY
jobs
UI
UI
BOSS
mySQL DB
GRID
EDG-RB
batch manager
WN1
Environment
WN2
CE
NFS
WNn
job executer
IMPALA
CMKIN
job
Апробация массовой генерации
LB
RC
UI
RB
JSS
Padova
II
CNAF
or
CERN
Padova
Moscow
LNL
CNAF
Useful References:
•
•
•
•
•
•
•
•
•
•
•
•
•
GLOBAL GRID FORUM: http://www.gridforum.org
European GRID FORUM: http://www.egrid.org
PPDG: http://www.ppdg.org
IVDGL : http://www.ivdgl.org
EU DATA GRID Project: http://www.eu-datagrid.org
DATATAG Project: http://www.datatag.org
GLOBUS Project: http://www.globus.org
GriPhynProject: http://www.griphyn.org
CrossGRID : http://www.cyfronet.krakow.pl/crossgrid
Condor: http://www.cs.wisc.edu/condor
TERAGRID Project: http://www.teragrid.org
RIVK-BAK Project: http://theory.sinp.msu.ru/~ilyin/RIVK-BAK
«Open Systems» Journal: http://www.osp.ru